Mô hình trọng số mở, tháng 9/2026: sát biên giới, nhưng chưa ngang hàng

Hồi tháng 7, khi Moonshot phát hành Kimi K3, Artificial Analysis báo cáo rằng khoảng cách giữa mô hình trọng số mở tốt nhất và mô hình độc quyền tốt nhất trên Intelligence Index của họ chỉ còn bốn điểm, mức nhỏ nhất kể từ tháng 2.

Hôm nay mô hình trọng số mở tốt nhất là MiMo-V2.6-Pro của Xiaomi với 46 điểm, còn mô hình độc quyền tốt nhất là Claude Opus 5.5 với 58 điểm (bảng xếp hạng, index v4.3.2). Khoảng cách là mười hai điểm.

Phía mô hình mở không hề đi lùi. Chuyện xảy ra là phần mà người ta hay quên của thị trường này: các phòng lab mô hình đóng cũng ra sản phẩm mới. Có ba điều đúng cùng lúc, và quyết định của bạn phụ thuộc vào việc bạn đang nhìn điều nào.

  1. Mô hình trọng số mở theo sau biên giới tính bằng tháng, không phải bằng năm.
  2. Đỉnh cao nhất vẫn là mô hình đóng, và nó rẻ đi sau mỗi lần phát hành.
  3. Những mô hình mở đứng đầu bảng không phải là những mô hình mà phần lớn các đội có thể tự chạy.

Khoảng cách dịch chuyển theo từng bậc

Đây là diễn biến trên index của Artificial Analysis trong năm nay. Index được đổi phiên bản khi các bài đánh giá bên trong được thay, nên hãy so sánh khoảng cách chứ đừng so điểm thô giữa các dòng:

Thời điểm Trọng số mở tốt nhất Độc quyền tốt nhất Khoảng cách
30 tháng 4 Kimi K2.6, MiMo V2.5 Pro (54) GPT-5.5 (60) 6
Tháng 7, Kimi K3 ra mắt Kimi K3 — 4
7 tháng 9 GLM-5.3, Kimi K3 (44) Claude Fable 5.1, GPT-6 Astra (53) 9
26 tháng 9 MiMo-V2.6-Pro (46) Claude Opus 5.5 (58) 12

Hình dạng của nó là răng cưa, không phải một đường xu hướng. Một bản phát hành mở thu hẹp khoảng cách, rồi một bản phát hành đóng lại nới rộng nó. Ngày 22 tháng 9, Anthropic ra mắt Opus 5.5 và OpenAI ra mắt GPT-6 Sol và Luna; cùng ngày đó MiMo-V2.6-Pro của Xiaomi trở thành mô hình mở tốt nhất hiện có. Nó ngang điểm với Grok 4.7 của xAI, một mô hình đóng ra mắt chỉ một ngày trước đó.

Tóm lại một cách trung thực: mô hình trọng số mở đi sau khoảng một chu kỳ phát hành. Với phần lớn công việc kinh doanh, chậm một chu kỳ là quá đủ. Với những việc agentic và suy luận khó nhất, đó vẫn là một khác biệt thật.

Ai đang dẫn đầu mảng mô hình mở

Gần như mọi mô hình ở nhóm đầu bảng mô hình mở đều đến từ các phòng lab Trung Quốc:

Mô hình Phòng lab Kích thước (tổng / kích hoạt) Ngữ cảnh Giấy phép
MiMo-V2.6-Pro Xiaomi 1,02T / 42B 1M MIT
GLM-5.3 Z.ai 753B 1M GLM-5.3 License
Kimi K3 Moonshot 2,8T / 104B 1M Kimi K3 License
DeepSeek V4.1-Flash DeepSeek 552B / 8–16B 1M MIT
Qwen3.8-2.4T-A95B Alibaba 2,4T / 95B 262K Qwen3.8-Max License

Các lựa chọn mở từ phương Tây nằm ở một hạng cân khác. Small 4 của Mistral có 119B tham số, 6,5B kích hoạt, giấy phép Apache 2.0. Gemma 4 của Google lớn nhất là 31B. Meta, sau hơn một năm không phát hành mô hình mở nào, đã công bố Muse Glimmer vào tháng 8: 30B, dense, Apache 2.0. Mô hình lớn hơn là Muse Spark vẫn đóng. Tất cả đều là mô hình tốt. Không mô hình nào cạnh tranh được với bảng ở trên.

Với một công ty phải trả lời cán bộ tuân thủ ở Mỹ hoặc có khách hàng là cơ quan chính phủ, điều này quan trọng. Ngày 8 tháng 9, NSA, CISA và FBI ban hành khuyến cáo AA26-251A, nêu tên DeepSeek, Moonshot, Alibaba, MiniMax, StepFun và Z.ai là đã tiến hành các chiến dịch chưng cất (distillation) “ở quy mô công nghiệp” nhắm vào các mô hình của Mỹ. Hai ngày sau, báo cáo mối đe dọa của Anthropic nêu tên bảy phòng lab có trụ sở tại Trung Quốc với khoảng 190 triệu lượt trao đổi. Khuyến cáo này nhắm vào các phòng lab, không nhắm vào người tải trọng số của họ về. Trọng số chạy trên phần cứng của bạn và không gửi gì đi đâu cả. Nhưng câu “chúng tôi đang chạy một mô hình mà chính phủ liên bang nói là được xây từ dữ liệu trích xuất trái phép” là câu mà một số bộ phận mua sắm sẽ không ký, và bạn nên biết bộ phận của mình có thuộc số đó không trước khi chọn mô hình, chứ không phải sau.

Đọc giấy phép, đừng đọc tiêu đề

“Trọng số mở” giờ bao gồm mọi thứ, từ MIT đến những giấy phép có ngưỡng ghi rõ. Ba loại đáng chú ý trong tháng này:

  • MIT (MiMo-V2.6-Pro, DeepSeek V4.1-Flash). Làm gì cũng được, chỉ cần giữ thông báo bản quyền.
  • Kimi K3 License. Dùng nội bộ được miễn. Nếu bạn bán mô hình dưới dạng dịch vụ và mảng kinh doanh đó vượt 20 triệu USD doanh thu trong 12 tháng, bạn cần một thỏa thuận riêng với Moonshot. Sản phẩm trên 100 triệu người dùng hằng tháng hoặc 20 triệu USD mỗi tháng phải hiển thị “Kimi K3” trên giao diện.
  • GLM-5.3 License. GLM-5.2 dùng MIT; 5.3 thì không. Hạn chế chỉ áp dụng cho các bên có doanh thu trên 10 tỷ USD bán suy luận dưới dạng dịch vụ, nên nó nhắm vào các hyperscaler. Với một công ty luật chạy nội bộ thì không có gì thay đổi. Nhưng đây là một giấy phép đã thay đổi giữa hai bản phát hành nhỏ, và bản tiếp theo cũng có thể đổi.

Cách Alibaba chia tách là điều cần theo dõi. Qwen3.8-27B dùng Apache 2.0. Checkpoint mở hạng Max là Qwen3.8-2.4T-A95B lại đi kèm giấy phép riêng, chỉ có văn bản, không có thị giác, ngữ cảnh 1 triệu token và công cụ tích hợp như API Qwen3.8-Max trả phí. Đó là mô hình mở đi sau API của chính phòng lab một cách có chủ đích, không phải tình cờ.

Và không mô hình nào trong số này là mã nguồn mở theo nghĩa của OSI. Bạn nhận được trọng số, không phải dữ liệu huấn luyện hay công thức. Bạn có thể chạy và tinh chỉnh nó; bạn không thể kiểm tra những gì đã được đưa vào nó.

Nơi đám mây đang thắng

Lợi thế của đám mây trước đây là năng lực. Giờ là năng lực và giá.

Mô hình Đầu vào / đầu ra mỗi 1 triệu token
GPT-6 Luna $0,10 / $0,50
DeepSeek V4.1-Flash (API DeepSeek, giờ cao điểm) $0,30 / $1,20
Gemini 3.8 Flash (đến 31/12) $0,75 / $3,75
GPT-6 Sol $2 / $10
Claude Opus 5.5 $4 / $20

Giá tại ngày 26 tháng 9 năm 2026. Giá thay đổi hằng tháng.

Hãy nhìn hai dòng đầu. Một mô hình đóng của OpenAI giờ có giá niêm yết mỗi token thấp hơn cả API của chính DeepSeek cho mô hình mở của họ (bảng giá DeepSeek). Claude Opus 5.5, mô hình đứng đầu index, rẻ hơn 20% so với bản Opus nó thay thế (bảng giá Anthropic), còn GPT-6 Sol và Luna có giá bằng một nửa GPT-5.6 (VentureBeat). Gemini 3.8 Flash là ngoại lệ đáng lưu ý: giá của nó tăng gấp đôi từ ngày 1 tháng 1.

Điều này làm lập luận tôi đưa ra trong bài về chi phí nội bộ và đám mây mạnh hơn, chứ không yếu đi. Nếu lý do duy nhất để chạy trọng số mở là token rẻ hơn, lý do đó ngày càng nhỏ lại.

Lựa chọn ở giữa: trọng số mở trên đám mây của người khác

“Mở” không còn đồng nghĩa với “trên phần cứng của bạn”. Ngày 18 tháng 9, Kimi K3 chính thức có mặt trên Amazon Bedrock, và AWS cho biết dữ liệu nằm trong phạm vi của AWS và không được chia sẻ với Moonshot. Bạn có một mô hình mở hạng biên giới mà không phải mua GPU nào, theo đúng hợp đồng đám mây bạn đang có.

Đây là câu trả lời đúng thường xuyên hơn người ta nghĩ. Nó giúp bạn không phụ thuộc vào API của riêng một phòng lab, và nếu sau này phải chuyển về nội bộ, bạn chuyển đúng bộ trọng số đó, chứ không phải một mô hình khác với hành vi khác.

Cái gì thực sự vừa phòng máy chủ của bạn

Nhóm đầu bảng mô hình mở là chuyện của trung tâm dữ liệu. Riêng trọng số của Kimi K3 đã khoảng 1,5 TB. MiMo-V2.6-Pro ở 4-bit là hơn 500 GB. Đây là những mô hình cần 8 đến 16 GPU. Kiến trúc mixture-of-experts khiến chúng nhanh so với kích thước, nhưng như tôi đã viết trong một GPU chạy được gì, nó không làm chúng nhỏ: mọi chuyên gia đều phải nằm trong bộ nhớ.

Thứ một doanh nghiệp thực tế triển khai thấp hơn một hoặc hai bậc:

  • Một card 24–48 GB: Qwen3.8-27B (dense, Apache 2.0, ngữ cảnh 262K), Gemma 4 31B, Muse Glimmer 30B. Khoảng 16–18 GB ở 4-bit.
  • 128 GB bộ nhớ hợp nhất (DGX Spark, Strix Halo) hoặc hai card trung tâm dữ liệu: Mistral Small 4 ở 4-bit, khoảng 65–75 GB, chỉ 6,5B tham số kích hoạt nên chạy nhanh. Xem bài so sánh DGX Spark và Ryzen AI Max+ 395.
  • Một node 8 GPU thuê hoặc tự sở hữu: DeepSeek V4.1-Flash trở lên.

Tin tốt là bậc này đã tiến bộ rất nhiều trong năm nay. Với hỏi đáp tài liệu, trích xuất và soạn thảo trên chính tài liệu của bạn, nơi phần truy xuất gánh phần lớn công việc, chừng đó là đủ.

Vậy tôi khuyên gì?

  • Nếu dữ liệu được phép rời khỏi công ty: dùng đám mây. Chọn theo giá và năng lực cho từng việc. Opus 5.5 hoặc GPT-6 Sol cho việc khó, Luna hoặc Flash cho khối lượng lớn.
  • Nếu bạn muốn trọng số mở nhưng không muốn lo phần cứng: chạy chúng trên Bedrock hoặc một dịch vụ quản lý tương tự. Bạn vẫn giữ được lựa chọn mang chính mô hình đó về nội bộ sau này.
  • Nếu dữ liệu không được rời đi: một mô hình mở 27B–120B trên phần cứng của bạn, với một hệ thống truy xuất tốt phía trước, đáp ứng phần lớn công việc thực tế. Chấp nhận rằng bạn chậm một chu kỳ ở những bài toán khó nhất, và chuyển những việc đó lên đám mây khi dữ liệu cho phép.
  • Dù chọn gì: đọc giấy phép của đúng checkpoint bạn dùng, hỏi bộ phận tuân thủ về nguồn gốc mô hình trước khi chuẩn hóa, và coi mọi con số trong bài này là một ảnh chụp nhanh. Các phòng lab đóng tiếp tục ra mắt, các phòng lab mở tiếp tục đuổi theo, và khoảng cách sẽ lại dịch chuyển khi bạn đọc đến đây.

Bài viết khác