Vào ngày 22 tháng 9 năm 2026, Chỉ số Bán dẫn Philadelphia đã mở rộng mức tăng lên 4%, đóng cửa ở 12.398,17 điểm. Theo dữ liệu thị trường của Gate, cổ phiếu Nvidia tăng 2,3% lên 227,38 USD, Broadcom tăng 1,6%, Advanced Micro Devices (AMD) leo 9,95%, ASML tăng 0,38% và Intel tăng 12,14%. Vốn hóa của AMD lần đầu tiên vượt mốc 1 nghìn tỷ USD, còn Arm vọt 17,16%.
Đằng sau đà tăng của tâm lý thị trường, một logic sâu hơn của ngành đang dần hiện rõ. Nhà thiết kế chip kỳ cựu và nhà phân tích phần cứng Mr. Bubble gần đây cho biết trong một cuộc phỏng vấn trên Frictionless Podcast rằng nút thắt cốt lõi của hạ tầng tính toán AI đang chuyển dịch khỏi việc chỉ đơn thuần tăng sức mạnh tính toán của chip. Sự chuyển dịch này đang hướng tới đóng gói tiên tiến, độ trễ liên kết hệ thống và quản lý phân cấp bộ nhớ. Ông cũng lưu ý rằng chi phí của quy trình sản xuất tiên tiến đang tăng rất nhanh, trong khi mức cải thiện mật độ transistor vẫn bị giới hạn, khiến Luật Moore truyền thống đối mặt với thách thức về kinh tế. Thay vì tiếp tục thu nhỏ các nút quy trình, ngành ngày càng kết nối nhiều chip thông qua đóng gói tiên tiến để tạo thành một hệ thống tính toán duy nhất.
Bài viết này sẽ phân tích cách phân phối giá trị trên chuỗi cung ứng chip AI đang được định hình lại theo bốn chiều: kinh tế quy trình, năng lực đóng gói, kiến trúc liên kết và phân cấp bộ nhớ.
Thách thức kinh tế của mở rộng quy mô quy trình và sự trỗi dậy của đóng gói tiên tiến
Trong nhiều năm, thị trường đã đo lường tiến bộ của chip bằng việc mật độ transistor tăng gần gấp đôi sau mỗi hai năm. Nhưng khung này đang đối mặt với một thách thức nghiêm trọng. Ông Mr. Bubble chỉ ra rằng khoản chi đầu tư (capex) cần thiết để chuyển sang các nút quy trình tiên tiến đã phình lên mức của nhiều chục tỷ USD, trong khi cải thiện mật độ transistor có thể chỉ từ 15% đến 20%—"Ngay cả việc nhân đôi số lượng transistor cũng không làm được."
Phản ứng của ngành trước thách thức này đang chuyển từ "thu nhỏ transistor" sang "mở rộng diện tích die". Đóng gói tiên tiến kết nối nhiều chip thành một hệ thống tính toán duy nhất, giúp chúng hoạt động về mặt logic như một chip. Xu hướng này đang làm thay đổi phân phối giá trị trên toàn chuỗi cung ứng bán dẫn.
Trung tâm Phát triển Công nghiệp Thông tin Trung Quốc (CCID) dự báo rằng, được thúc đẩy bởi đà tăng trưởng liên tục của các đơn hàng bộ tăng tốc AI và sự tiến hóa của các stack HBM lên từ 12 lớp trở lên, thị trường đóng gói tiên tiến toàn cầu sẽ đạt 58,1 tỷ USD vào năm 2026. Đến năm 2030, quy mô thị trường dự kiến tiến gần 80 tỷ USD. Các tính toán của Morgan Stanley cũng đi theo cùng hướng: thị trường đóng gói tiên tiến toàn cầu năm 2026 ước tính khoảng 56,0–58,0 tỷ USD, lần đầu tiên khiến tỷ trọng trong toàn bộ chuỗi giá trị OSAT/đóng gói và thử nghiệm vượt 50%. Trong đó, biên lợi nhuận của các gói dành riêng cho AI có thể lên tới 48%–55%, khiến đây là phân khúc sinh lời cao nhất trong chuỗi giá trị bán dẫn.
Trong cuộc gọi công bố kết quả kinh doanh quý 4 năm 2025, ASE cho biết do nhu cầu bán dẫn tăng lên nhờ việc áp dụng AI và thị trường nhìn chung đang phục hồi, doanh thu mảng đóng gói và thử nghiệm tiên tiến năm 2026 dự kiến sẽ tăng gấp đôi từ 1,6 tỷ USD lên 3,2 tỷ USD, trong đó khoảng 75% đến từ đóng gói và 25% từ thử nghiệm. TSMC, trong khi đó, cho biết tỷ trọng doanh thu đóng gói tiên tiến năm 2025 nhỉnh hơn 10%. Công ty kỳ vọng tăng trưởng sẽ vượt mức trung bình của mình và đóng gói tiên tiến sẽ chiếm "tầm thấp hai chữ số" trong doanh thu năm 2026. Ngoài ra, khoảng 10%–20% capex năm 2026 sẽ được phân bổ cho đóng gói tiên tiến, thử nghiệm, gia công photomask và các dự án khác.
Mở rộng năng lực CoWoS và khoảng cách cung–cầu vẫn dai dẳng
Tốc độ mở rộng năng lực CoWoS của TSMC là một "cửa sổ" quan trọng để quan sát các nút thắt của đóng gói tiên tiến. Dựa trên dữ liệu TrendForce, sản lượng CoWoS theo tháng của TSMC được kỳ vọng tiếp tục tăng từ khoảng 70.000 wafer trong năm 2025 lên 120.000–140.000 wafer vào cuối năm 2026. Sản lượng theo tháng trong năm 2027 có thể tăng thêm lên khoảng 200.000 wafer. Dự báo của JPMorgan có khác biệt nhẹ: họ kỳ vọng năng lực theo tháng của CoWoS đạt 115.000 wafer, 190.000 wafer và 225.000 wafer lần lượt vào cuối các năm 2026, 2027 và 2028.
Dù năng lực tăng nhanh, các khoảng cách cung–cầu vẫn tồn tại. Theo thông tin chuỗi cung ứng, Nvidia đã đặt trước 800.000 đến 850.000 wafer năng lực CoWoS tại TSMC cho năm 2026, qua đó đảm bảo hơn một nửa phân bổ cả năm. Sau khi các khách hàng thuộc nhóm top-tier tiêu thụ phần lớn năng lực, nguồn đóng gói dành cho Broadcom, AMD và chip tùy chỉnh của các khách hàng cloud nhìn chung khá hạn chế. DIGITIMES dự kiến tỷ trọng CoWoS-L trong năng lực CoWoS của TSMC sẽ tăng lên khoảng 75% trong quý 4 năm 2026, với năng lực mới chủ yếu tập trung vào các chip AI cỡ lớn.
Sự thay đổi lộ trình của Nvidia phản ánh trực tiếp các ràng buộc trong thực tế của nút thắt đóng gói. Như ông Mr. Bubble đã phân tích, ban đầu Nvidia dự định đóng gói bốn die trần trong kiến trúc Rubin Ultra. Nhưng do giới hạn vật lý của đóng gói, công ty buộc phải hạ xuống còn hai die trần mỗi nhóm đóng gói, sau đó kết nối hai nhóm đã đóng gói này qua một PCB. Điều này có nghĩa là các nhà sản xuất PCB đã trở thành một nút thắt mới trong chuỗi liên kết tính toán: họ cần đảm bảo rằng các chip được tách ra bởi vài xentimét có thể hoạt động cùng nhau như một chip đơn lẻ.
Tính "chật" kéo dài của CoWoS đang thúc đẩy mở rộng hệ sinh thái cung cấp đóng gói tiên tiến. Một số công đoạn CoWoS ở phía back-end đang dần được giao cho các OSAT như ASE/StatsChip, Amkor và JCET. Ví dụ, năng lực theo tháng liên quan đến ASE/StatsChip dự kiến tăng từ khoảng 30.000 wafer trong năm 2026 lên khoảng 50.000 wafer trong năm 2027, trong khi Amkor được kỳ vọng tăng từ khoảng 20.000 wafer lên khoảng 30.000 wafer. Cấu trúc ngành đang dịch chuyển từ thế thống trị của TSMC tại một "điểm" duy nhất sang mô hình mở rộng nhiều bên tham gia, bao gồm các nhà máy wafer fab, OSAT, nhà sản xuất substrate và các công ty tấm nền hiển thị.
Phân cấp bộ nhớ được định hình lại: sau HBM, cuộc cạnh tranh chuyển sang flash và 3D DRAM
Khi suy luận AI mở rộng cửa sổ ngữ cảnh từ 128K lên quy mô hàng triệu token, năng lực bộ nhớ đang chịu áp lực chưa từng có. Nhưng ông Mr. Bubble đưa ra một cách phân tách mang tính thực tiễn: trọng số mô hình nên được giữ trong HBM, trong khi ngữ cảnh lịch sử khổng lồ không cần phải chiếm không gian HBM đắt đỏ. Ngữ cảnh tần suất thấp có thể được di chuyển sang một tầng lưu trữ flash có dung lượng lớn hơn và chi phí thấp hơn.
Động lực cung–cầu đối với chip bộ nhớ xác nhận mức độ gấp rút của xu hướng này. Theo dự báo của IDC, trong năm 2026, nguồn cung DRAM toàn cầu chỉ tăng 16% so với cùng kỳ năm trước, trong khi NAND tăng 17%—cả hai đều thấp hơn mức trung bình lịch sử. Trong khi đó, tốc độ tăng trưởng nhu cầu được kỳ vọng lần lượt là 45% và 38%. Kết quả là, khoảng cách cung–cầu sẽ tiếp tục nới rộng trong nửa đầu năm 2027. SK hynix cho biết toàn bộ năng lực HBM của công ty trong năm 2026 đã được đặt trước vào cuối năm 2025 cho các khách hàng trọng yếu, bao gồm Nvidia và AMD. Nhìn chung, ngành đang thể hiện hiện tượng "spot premium".
Dữ liệu TrendForce cho thấy doanh thu ngành DRAM tăng theo quý 59,5% trong quý 2 năm 2026. Doanh thu của SK hynix tăng 37,9% theo quý lên 38,59 tỷ USD, với thị phần 24,9%. Doanh thu của Micron Technology tăng 65,5% theo quý lên 36,0 tỷ USD và thị phần tăng lên 23,3%. Choi Tae-won, Chủ tịch của SK Group Hàn Quốc, gần đây cho biết vì việc sản xuất chip đối mặt với các nút thắt mang tính hệ thống, tình trạng thiếu chip bộ nhớ toàn cầu có khả năng tiếp tục kéo dài đến năm 2030.
Về dài hạn, định hướng công nghệ chỉ sang 3D DRAM—kết nối trực tiếp DRAM phía trên các chip logic. Bằng cách rút ngắn mạnh khoảng cách vật lý, công nghệ này giảm độ trễ, tăng băng thông và giảm mức tiêu thụ điện năng. Tại Hot Chips 2026, d-Matrix đã trình bày bộ tăng tốc suy luận tạo sinh Raptor 3D-DRAM. Một thẻ kết hợp 32 GB 3D DRAM với khoảng 100 TB/s băng thông bộ nhớ, chỉ yêu cầu gần 0,37 picojoules cho mỗi bit truyền đi. Trong kiến trúc này, die logic tính toán được xếp chồng trực tiếp lên trên DRAM. Mỗi chiplet cung cấp 4 GB bộ nhớ và khoảng 12,5 TB/s băng thông, và tám chiplet tạo thành một thẻ. Kết quả từ tài liệu cho thấy Raptor đạt thông lượng suy luận cao hơn 4,71 lần so với cấu hình HBM trên nhiều mô hình sinh, và cao hơn 2,44 lần so với cấu hình tham chiếu SRAM. d-Matrix dự kiến hoàn tất tape-out của Raptor vào cuối năm 2026 và đã tích hợp giải pháp này vào hệ sinh thái NVLink Fusion của Nvidia.
Thiết kế cấp hệ thống trở thành một rào cản mới: chuyển dịch mô hình từ chip sang rack
Với ông Mr. Bubble, đơn vị nền tảng của tính toán AI không còn là một chip đơn lẻ, hay thậm chí là một máy chủ đơn lẻ. Đó là cả một rack—và đôi khi là nhiều rack. Lý do cốt lõi là các chiến lược song song hóa cho huấn luyện và suy luận các mô hình lớn khiến băng thông và độ trễ liên kết giữa các chip trở thành yếu tố quyết định cho hiệu quả của cả cụm.
Nvidia xử lý các liên kết băng thông cao thông qua hệ thống NVL72 và NVSwitch. Nhưng các switch chiếm không gian vật lý vốn có thể dùng cho GPU. Nhóm TPU của Google chọn một hướng đi hoàn toàn khác: họ đưa một phần logic định tuyến trực tiếp vào bên trong chip, do đó chip cũng đóng vai trò như một bộ định tuyến giả lập. Miền mở rộng Scale-up của họ lên tới 9.600 chip, qua đó giúp lý giải vì sao cấu hình HBM cho mỗi thẻ của TPU thấp hơn so với GPU Nvidia—nhưng TPU vẫn có thể hỗ trợ huấn luyện ở quy mô cực lớn.
Công nghệ liên kết đang trải qua một sự chuyển dịch mô hình từ cáp đồng sang quang. Tháng 3 năm 2026, ba "ông lớn" chip—AMD, Broadcom và Nvidia—đã cùng với Microsoft, Meta và OpenAI thành lập nhóm công tác giao thức đa nguồn liên kết tính toán quang. Nhiệm vụ cốt lõi là phát triển một lớp vật lý quang phổ dụng và các thành phần thống nhất, thay thế các cáp đồng truyền thống bằng sợi quang. Theo kế hoạch, chuẩn sẽ hỗ trợ các kết nối mở rộng theo chiều dọc cả trong hệ thống AI và giữa các rack. Cuối cùng, tốc độ truyền dữ liệu sẽ đạt 3,2 Tb/s. Khác với các chuẩn công nghệ độc quyền trước đây, đặc tả OCI theo triết lý thiết kế "không phụ thuộc vào giao thức" (protocol-agnostic). Nó có thể hỗ trợ cả giao thức NVLink của Nvidia và UALink do AMD và Broadcom dẫn dắt.
Ở phía suy luận, "tách prefill–decoding" đang nổi lên như mô hình kiến trúc chủ đạo. Thiết kế tham chiếu của Kimi triển khai hai giai đoạn trên các node khác nhau, và kiến trúc này đang được áp dụng rộng rãi. Giai đoạn prefill đòi hỏi tính toán nặng, trong khi giai đoạn decoding cần băng thông bộ nhớ lớn. Việc tách và triển khai riêng có thể cải thiện đáng kể hiệu quả tổng thể của hệ thống.
Giá trị dài hạn ở lớp phần cứng: vì sao "sở hữu đường ray" đáng tin cậy hơn "cược vào chuyến tàu"
Logic đầu tư của ông Mr. Bubble vẫn nhất quán: thay vì cược vào các phòng thí nghiệm AI tuyến đầu cạnh tranh, tốt hơn là nắm giữ các công ty sở hữu năng lực hạ tầng thiết yếu, bao gồm phần cứng, đóng gói, lưu trữ và các thành phần cốt lõi khác. Logic này đã được xác thực qua hiệu suất thị trường gần đây.
Tính đến phiên đóng cửa ngày 22 tháng 9 năm 2026 (giờ Bắc Kinh), dữ liệu thị trường của Gate cho thấy Nvidia giao dịch ở mức 227,38 USD, tăng 2,30%. TSMC ADR ở 445,14 USD, tăng 2,41%. Micron Technology ở 1.043,96 USD, tăng 2,77%. SK hynix ADR ở 188,86 USD, tăng 0,73%. Intel tăng 12,14%, và AMD tăng 9,95%, với vốn hóa thị trường lần đầu tiên vượt ngưỡng 1 nghìn tỷ USD.
Giá cổ phiếu Nvidia, nguồn: Gate quotes thị trường cổ phiếu
Giá cổ phiếu Intel, nguồn: Gate quotes thị trường cổ phiếu

Giá cổ phiếu AMD, nguồn: Gate quotes thị trường cổ phiếu
JPMorgan đã nâng dự báo năng lực CoWoS theo tháng của TSMC vào cuối các năm 2026, 2027 và 2028 lần lượt lên 115.000 wafer, 190.000 wafer và 225.000 wafer, đồng thời cho biết tình trạng thiếu CoWoS đang ngày càng nới rộng. Evercore kỳ vọng năng lực laser được điều chế bằng hấp thụ điện (EAM) của Broadcom sẽ tăng từ khoảng 43 triệu lên 44 triệu đơn vị trong năm 2025 lên 50 triệu đơn vị trong năm 2026, phản ánh mức tăng trưởng mang tính cấu trúc của nhu cầu liên kết. Ba công ty này—dù là quan điểm của Astera Labs rằng hàm lượng liên kết đơn chip Scale-up tiếp tục tăng, hay hướng dẫn của Marvell về tốc độ tăng trưởng mảng kết nối của hãng, hoặc nhấn mạnh của Intel rằng đóng gói tiên tiến là nút thắt của toàn ngành—đều đang hướng tới cùng một kết luận: liên kết, đóng gói và bộ nhớ đang trở thành những thành phần khan hiếm mới trong hạ tầng AI.
Kết luận
Trọng tâm cạnh tranh của hạ tầng tính toán AI đang chuyển từ các bước đột phá đơn lẻ nhờ thu nhỏ quy trình sang phối hợp cấp hệ thống giữa đóng gói, liên kết và lưu trữ. Thách thức từ kinh tế của Luật Moore không có nghĩa là tăng trưởng tính toán đang dừng lại. Nó có nghĩa là phân phối giá trị đang chuyển từ "ai sở hữu nút quy trình tiên tiến nhất" sang "ai kiểm soát nút thắt quan trọng nhất". Tình trạng khan hiếm về năng lực đóng gói tiên tiến, cung–cầu HBM chặt chẽ, định hướng bù trừ bằng flash và quá trình công nghiệp hóa 3D DRAM, cùng với vị trí nút thắt mới của PCB và các liên kết cấp hệ thống, tất cả hình thành "đường dây chính" mới trong hoạt động đầu tư cổ phiếu chip tại Mỹ.
Với các nhà đầu tư theo dõi xu hướng này, việc hiểu logic xếp chồng vật lý từ chip sang rack có thể quan trọng hơn nhiều so với việc chạy theo biến động ngắn hạn của bất kỳ một mục tiêu đơn lẻ nào. Như ông Mr. Bubble đã nói—"những người sở hữu đường ray đáng nắm giữ dài hạn hơn những công ty chỉ đang xây tàu."
Câu hỏi thường gặp (FAQ)
Câu 1: Vì sao đóng gói tiên tiến được gọi là "Luật Moore mới"?
Luật Moore truyền thống dựa vào việc thu nhỏ bằng quang khắc để tăng mật độ transistor. Nhưng capex cho các quy trình tiên tiến đã phình lên mức của nhiều chục tỷ USD, trong khi cải thiện mật độ chỉ có thể ở mức 15%–20%. Đóng gói tiên tiến kết nối nhiều chip thành một hệ thống tích hợp, sử dụng "mở rộng diện tích die" thay vì "thu nhỏ transistor", nhờ đó tạo thành lộ trình mở rộng tính toán khả thi hơn về mặt kinh tế.
Câu 2: Sau HBM, các hướng công nghệ lưu trữ là gì?
Trong ngắn hạn, việc offload sang flash là một giải pháp mang tính thực dụng để mang theo các ngữ cảnh suy luận khổng lồ. Trong trung hạn, 3D DRAM—bằng cách liên kết theo chiều dọc DRAM phía trên chip logic—được kỳ vọng vừa có thể giảm độ trễ, vừa tăng băng thông và đồng thời giảm tiêu thụ điện năng. Raptor của d-Matrix đã chứng minh giải pháp 3D-DRAM với băng thông trên 100 TB/s tại Hot Chips 2026, và dự kiến hoàn tất tape-out vào cuối năm 2026.
Câu 3: Vì sao các nhà sản xuất PCB đang trở thành một nút thắt mới cho chip AI?
Khi một gói (package) không thể chứa nhiều die trần hơn, chip cần các liên kết tốc độ cao được triển khai thông qua PCB. Rubin Ultra của Nvidia đã chuyển từ thiết kế đóng gói bốn die trần xuống thiết kế "double-packaged" với hai die trần. Truyền tín hiệu giữa hai nhóm đã đóng gói phụ thuộc vào năng lực quy trình của nhà sản xuất PCB. Điều này biến PCB từ một đầu nối thụ động thành một nút thắt chủ động, giới hạn nhịp độ mở rộng tính toán.
Câu 4: Sau GPU, nhà đầu tư chip AI nên tập trung vào những mảng nào?
Đối với đóng gói: tập trung vào các đơn vị hưởng lợi từ việc mở rộng năng lực CoWoS và các công ty đảm nhận công việc ở OSAT. Đối với liên kết: tập trung vào các bên hỗ trợ triển khai chuẩn liên kết quang (OCI). Đối với lưu trữ: tập trung vào các nhà cung cấp HBM, các nhà đổi mới công nghệ 3D DRAM giai đoạn đầu và các nhà thiết kế bộ điều khiển flash. Ở cấp hệ thống: tập trung vào các công ty dẫn đầu về năng lực thiết kế cấp rack.
Câu 5: Các định giá ở mảng bán dẫn Mỹ hiện tại có hợp lý không?
Tính đến ngày 22 tháng 9 (giờ Bắc Kinh), Chỉ số Bán dẫn Philadelphia ở mức 12.398,17. P/E (TTM) của TSMC ADR vào khoảng 33 lần. Do hạ tầng tính toán AI vẫn đang trong chu kỳ mở rộng mang tính cấu trúc, các khoảng cách cung–cầu trong đóng gói tiên tiến và HBM dự kiến sẽ còn kéo dài sau năm 2027, và tăng trưởng lợi nhuận ở các công ty dẫn đầu có thể hấp thụ các định giá hiện tại. Tuy nhiên, nhà đầu tư cần theo dõi các rủi ro tiềm ẩn, bao gồm các biện pháp kiểm soát xuất khẩu, yếu tố địa chính trị và khả năng việc mở rộng năng lực diễn ra chậm hơn dự kiến.




