BTC $62,983.7 -2.78%
ETH $1,866.41 -2.69%
SOL $72.97 -2.07%
BNB $588.1 -0.74%
XRP $1.06 -1.86%
DOGE $0.0698 -0.77%
ADA $0.1692 -0.35%
AVAX $6.39 -0.68%
DOT $0.7590 -1.20%
LINK $8.18 -2.96%
⛽ ETH Gas 28 Gwei
Sợ&Tham
27

Mira Murati vừa mở khóa 276B tham số — nhưng tín hiệu thật nằm ở con số 171GB

Chính sách | Nguyễn Việt |
Thông tin vừa lọt vào radar. Thinking Machines Lab — công ty do Mira Murati, cựu CTO OpenAI, đứng đầu — phát hành mô hình mã nguồn mở Inkling-Small. Con số gây sốc không phải 276B tham số tổng, cũng không phải 12B tham số kích hoạt. Nó là 171GB — kích thước file weight sau khi lượng tử hóa. Dân trading hay nói: FOMO quay lại rồi – check volume đi. Nhưng ở đây, volume chính là 171GB. Mô hình này đạt 40 điểm trên Intelligence Index, kém đúng 1 điểm so với bản lớn Inkling — nhưng lại vượt mặt ở SWE-bench Verified và HLE. Nghe phi lý. Nhưng tôi đã học được từ vụ ICO Filecoin năm 2017: thứ thị trường FOMO nhất thường không phải thứ đáng giá nhất. Năm đó tôi mua token chỉ vì một dòng tweet của Vitalik, lời gấp 3 sau ba tháng, rồi không bán kịp vì gas fee cao. Bài học vẫn vẹn nguyên: tốc độ nhận định phải đi kèm hạ tầng kỹ thuật. Bối cảnh không thể bỏ qua. Mira Murati rời OpenAI cuối năm 2024, tạo ra chấn động không nhỏ trên toàn ngành. Cô ấy mang theo danh tiếng của một người từng điều hành các dự án an toàn AI tại công ty có giá trị nhất hành tinh. Thinking Machines Lab ra đời với cam kết "đưa AI về tay người dùng". Và giờ họ phát hành mô hình với giấy phép Apache 2.0 — loại giấy phép cởi mở nhất về mặt thương mại. Không phí bản quyền. Không hạn chế sử dụng. Nghe giống một cú hích dân chủ hóa AI. Nhưng hãy nhìn kỹ hơn. Vì thực tế không bao giờ nằm trên bề mặt. Về kỹ thuật, Inkling-Small là mô hình MoE — mixture of experts. Tổng cộng 276B tham số, nhưng mỗi lần suy luận chỉ kích hoạt 12B. Bản lớn Inkling có 975B tổng, 41B kích hoạt. Tỷ lệ giữa hai bản gần như không đổi: 1:3,5. Cùng một kiến trúc, chỉ khác quy mô. Vậy mà hiệu năng không giảm tương ứng. Inkling-Small đạt 40 điểm trong khi Inkling đạt 41 — chênh lệch chỉ 2,4%. Tệ hơn nữa, ở SWE-bench Verified — bài kiểm tra viết code trên repo thực — và HLE, bản nhỏ còn vượt bản lớn. Trả 30% chi phí, nhận 97,5% "trí thông minh". Kiểu tương quan như vậy không bình thường. Chuyện gì đang diễn ra? Tôi không tin vào phép màu. Từ kinh nghiệm vận hành bot mint NFT năm 2021, tôi biết một điều: khi hệ thống nhỏ hơn mà tối ưu hơn, gần như chắc chắn có sự định hướng dữ liệu. Inkling-Small không phải bản sao cắt giảm của Inkling. Nó được huấn luyện với tỷ lệ dữ liệu code, toán, suy luận cao hơn hẳn. Kiểu huấn luyện theo lộ trình — curriculum learning — nhấn mạnh các chủ đề chiến lược. Họ chấp nhận hy sinh kiến thức tổng quát: bài test về độ bao phủ thực tế cho thấy Inkling vẫn vượt trội ở khả năng trả lời các câu hỏi chung. Nhưng bù lại, trong các tác vụ chuyên biệt như lập trình, bản nhỏ thắng rõ ràng. Đây là một dạng arbitrage thông minh. Xác định mục tiêu hẹp, đổ dữ liệu chuyên sâu, tối ưu đúng chỗ. Về thương mại, giá là 1,20 USD mỗi triệu output token. Rẻ hơn khoảng 70% so với Inkling. Nhưng vì chỉ kích hoạt 12B tham số — ít hơn 3,4 lần — chi phí vận hành mỗi request thực tế thấp hơn nhiều. Kiến trúc "training nặng, inference nhẹ" cho phép họ bán rẻ mà vẫn giữ biên lợi nhuận khả quan. Tôi đã nhìn thấy mô hình này trước đây. Năm 2020, khi tôi thử yield farming trên Compound, tôi nhận ra một điều: những giao thức có phí gas thấp hơn không phải vì họ "tốt bụng", mà vì họ tối ưu kiến trúc hợp đồng thông minh. Chi phí thấp là một lợi thế cấu trúc, không phải sự hào phóng. Inkling-Small cũng vậy. Giá 1,20 USD không phải khuyến mại, nó là hệ quả của thiết kế. Nhưng tôi muốn dừng lại ở chi tiết mà phần lớn báo cáo bỏ qua: 171GB. Weight mã nguồn mở nặng 171GB ngay cả khi đã lượng tử hóa. Không phải thứ một developer cá nhân với laptop chạy được. Nó cần GPU cluster, hạ tầng doanh nghiệp. Apache 2.0 nghe có vẻ hào phóng, nhưng thực tế, điều kiện cần để sử dụng nó là một phòng server. Vậy nên loại "open-source" này có bản chất B2B, không phải "AI cho mọi người". Đối với các công ty blockchain muốn tích hợp mô hình AI, đây là tin tốt: họ có hạ tầng sẵn, họ sẽ được hưởng lợi nhiều nhất. Nhưng đừng gọi đây là dân chủ hóa. Hãy gọi đúng tên: phân khúc doanh nghiệp với chi phí triển khai giảm mạnh. Một chi tiết nữa: đa phương thức. Inkling-Small nhận đầu vào văn bản, hình ảnh, âm thanh. Nhưng không có bất kỳ mô tả nào về khả năng sinh ra hình ảnh hay âm thanh. Đây là mô hình hiểu, không phải mô hình tạo sinh. Điều đó giảm tải tính toán rất lớn, giúp giữ giá thành thấp. Nhưng cũng đồng nghĩa cạnh tranh với các mô hình toàn năng như Gemini vẫn là cuộc chơi khác. Vị trí thực sự của Inkling-Small nằm ở những tác vụ hẹp, nơi tốc độ và chi phí quan trọng hơn sự toàn diện. Hãy nhìn cách họ chọn "điểm neo" cho câu chuyện so sánh. Họ so sánh Inkling-Small với chính Inkling — "chỉ kém 1 điểm". Họ không nhắc đến GPT-4, Claude, hay Gemini. Tại sao? Vì trên bảng xếp hạng toàn cầu, 40 điểm không nằm ở vị trí dẫn đầu. Các mô hình tốt nhất thường neo quanh mức 50+. Điểm của Inkling-Small nằm ở miền trung bình của bảng xếp hạng. So sánh nội bộ "chỉ kém 1 điểm" là cách khuếch đại một sự thật nhỏ hơn nhiều. Trong trading, chúng tôi gọi đó là "painting the tape" — vẽ biểu đồ theo ý muốn, chọn khung hình có lợi nhất. Điều này không làm giảm giá trị kỹ thuật của mô hình, nhưng nó cho bạn biết cách đọc thông cáo báo chí: không tin bất kỳ con số nào trước khi tự kiểm tra. Còn một khoảng trống rất đáng chú ý: an toàn. Không có thông tin về alignment, không có báo cáo red team, không có mô tả về cơ chế từ chối các yêu cầu độc hại. Trong khi đó, Apache 2.0 nghĩa là weight nằm ngoài tầm kiểm soát của họ vĩnh viễn. Bất kỳ ai cũng có thể tinh chỉnh, loại bỏ các lớp bảo vệ, hoặc biến mô hình thành công cụ không mong muốn. Với một công ty do cựu CTO OpenAI đứng đầu — người từng đặt an toàn AI lên hàng đầu — sự im lặng này là tín hiệu mạnh mẽ. Hoặc đội ngũ an toàn còn quá non, hoặc họ đang giấu thứ không muốn công bố. Dù là gì, thị trường đang bỏ qua. FOMO thường làm vậy. Giá sàn BAYC từng chứng minh: khi thanh khoản cạn, chẳng còn gì để nói. Còn nhiều câu hỏi chưa có lời giải đáp. Có free tier không? Hạn mức bao nhiêu? Có dịch vụ fine-tuning không? SLA như thế nào? Dữ liệu người dùng có được giữ tại EU hay châu Á không? Những chi tiết đó quyết định việc áp dụng trong doanh nghiệp — và thị trường crypto cũng là doanh nghiệp theo cách của nó. Khi các câu trả lời được công bố, tôi sẽ nhìn vào volume adoption. Còn bây giờ, mọi thứ vẫn là một vụ cá cược. Với những người quan tâm đến giao điểm AI và blockchain: đừng nhìn vào điểm số. Hãy nhìn vào giá trên mỗi token và khối lượng vận hành. Khi một mô hình "nhỏ nhưng sâu" ra mắt với giá thấp hơn 70%, toàn bộ đường cong giá trong thị trường model API sẽ chịu áp lực. Các dự án AI-agent trên crypto sẽ có lựa chọn hiệu quả hơn về chi phí — điều này có thể kích thích làn sóng tích hợp mới. Nhưng câu hỏi ngược lại: Thinking Machines Lab sẽ thu lợi thế nào? Nếu bán API rẻ và mở weight, họ cần dữ liệu hoặc vốn để tiếp tục chạy đua. Với ước tính chi phí huấn luyện một mô hình gần 1.000B tham số, cần hàng nghìn GPU H100 hoạt động trong nhiều tháng. Con số đó lên tới hàng chục triệu đô la. Họ đang chơi một ván cờ với nguồn lực khổng lồ. Chiến lược giá thấp lúc này là để chiếm thị phần, không phải để có lãi. Câu hỏi thực sự: họ sẽ gọi vốn bao nhiêu, và từ ai. Và hãy nhớ: tất cả những con số này chưa được kiểm chứng độc lập. Không có báo cáo kỹ thuật đầy đủ, không có model card, không có kiểm tra từ bên thứ ba. Trong một thị trường mà mọi dự án đều tung ra benchmark đẹp, thói quen audit code dạy tôi rằng: chỉ tin những gì bạn có thể tự chạy. Và để tự chạy con số 171GB này, bạn cần nhiều hơn một chiếc laptop. FOMO quay lại rồi – check volume đi. Không chỉ volume giao dịch token AI trên các sàn, mà còn volume dữ liệu: 171GB, con số thực sự nói lên câu chuyện. Khi mọi người đều nhìn vào điểm benchmark, người chiến thắng là người nhìn vào chi phí vận hành mỗi đơn vị thông minh. Hãy in kết luận đó vào chiến lược của bạn.

Mira Murati vừa mở khóa 276B tham số — nhưng tín hiệu thật nằm ở con số 171GB

Mira Murati vừa mở khóa 276B tham số — nhưng tín hiệu thật nằm ở con số 171GB

Mira Murati vừa mở khóa 276B tham số — nhưng tín hiệu thật nằm ở con số 171GB