Trong 7 ngày qua, một bài báo trên Crypto Briefing tuyên bố Grok 4.5 – một phiên bản AI không tồn tại – đã vượt qua Claude Fable 5 và GPT-5.6 Sol trên benchmark VulcanBench. Khi tôi đào sâu vào mã nguồn và dữ liệu, mọi thứ vỡ vụn như một smart contract không được audit.
## Context: Kẻ lạ mặt trong thế giới AI Crypto Briefing, một trang tin chuyên về tiền mã hóa, vừa đăng tải bài viết với tiêu đề “Grok 4.5 tops AI coding benchmarks – AI investors should pay attention”. Nội dung cho thấy mô hình mới của xAI đạt hiệu suất vượt trội trong các tác vụ lập trình, với chi phí thấp hơn 40% so với đối thủ. Vấn đề: không ai trong giới AI từng nghe đến Grok 4.5, Claude Fable 5 hay GPT-5.6 Sol. VulcanBench cũng không xuất hiện trên bất kỳ danh sách benchmark uy tín nào như SWE-bench Verified, HumanEval hay CodeContests.
Đối với tôi – một kỹ sư từng audit contract ICO năm 2017 và phát hiện lỗi trong cơ chế bỏ phiếu của Aragon – đây là dấu hiệu quen thuộc của thông tin nhiễu. Trong crypto, chúng ta thường thấy các dự án tuyên bố TVL khủng, APY ảo nhưng không có mã nguồn minh bạch. Ở đây, benchmark là TVL, và model là token.
## Core: Phân tích kỹ thuật từng con số Tôi bắt đầu bằng việc tra cứu tên các model. Theo dữ liệu công khai đến tháng 3/2025, xAI chỉ mới phát hành Grok-1 và Grok-2. Anthropic có Claude 3.5 Sonnet và Opus. OpenAI có GPT-4o và o1. Không có bất kỳ thông báo nào về Claude Fable 5 (có thể là tên nội bộ?) hay GPT-5.6 Sol. Ngay cả phiên bản GPT-5 cũng chưa ra mắt. Việc so sánh một model không tồn tại với hai model khác cũng không tồn tại là vô nghĩa.
Benchmark VulcanBench càng đáng ngờ. Tôi search trên Google Scholar, Hugging Face, thậm chí GitHub – không một kết quả nào. Một benchmark mới thường có dataset mở. Nếu không, đó là tự tạo. Dựa trên kinh nghiệm audit của tôi, khi một dự án không công bố mã nguồn kiểm toán, bạn coi như nó có lỗi. Ở đây, VulcanBench là một black box hoàn hảo.
Chi phí thấp hơn 40% – con số này cũng mơ hồ. Không định nghĩa “task” là gì: một dòng code? Một hàm? Một PR? Cũng không nói rõ hardware nào. Có thể họ dùng GPU giá rẻ so sánh với GPU đắt tiền. Trong tối ưu hóa zk-SNARKs, tôi từng thấy nhiều team tuyên bố giảm 90% thời gian nhưng chỉ trên một case đặc biệt. Không có thực nghiệm đối chứng mù, con số này vô giá trị.
Tôi quyết định mô phỏng lại: giả sử Grok 4.5 thật sự tồn tại, nó cần một lượng FLOPs khổng lồ để đạt performance đó. Ngay cả với 10 vạn H100, xAI cũng không thể train một model ngang GPT-4 trong vài tháng. Thời gian từ Grok-2 (11/2024) đến nay chỉ 4 tháng – không đủ để đột phá tới mức “vượt trội”. Đây là benchmark giả.
## Contrarian: Tại sao crypto media lại đăng? Góc nhìn phản trực giác: không phải vì họ ngu dốt, mà vì họ có động cơ. Crypto Briefing thường đưa tin về các token và ICO. Bài viết này có thể là mồi nhử cho một đợt pump – có thể là token liên quan đến xAI? Hoặc gây chú ý để xAI gọi vốn? Trong thị trường đi ngang hiện tại, các dự án cần tín hiệu tích cực để giữ TVL. Bài viết này là một “tín hiệu” – dù giả mạo.
Điểm mù bảo mật: ngay cả khi Grok 4.5 thật, việc đặt niềm tin vào một model AI chưa được audit độc lập là rủi ro. Trong DeFi, chúng ta thấy các dự án copy code Uniswap nhưng thêm backdoor. AI model cũng vậy: có thể bị backdoor data hoặc có lỗ hổng bảo mật. Nhưng bài báo không hề đề cập.
## Takeaway: Đừng để con số làm bạn quên mất code Bài học rõ ràng: hãy kiểm tra mã nguồn. Khi một benchmark không mở, coi như không tồn tại. Khi model không có API, coi như không có. Trong crypto, chúng ta audit smart contract. Trong AI, chúng ta audit benchmark. Càng nhiều tuyên bố công nghệ hão huyền, càng cần kỹ năng đào sâu như tôi từng làm với Aragon. Thông tin vô giá trị nếu không thể tái tạo.
Tôi cá rằng sẽ còn nhiều tin tương tự trong 6 tháng tới – mỗi khi market sideway. Các dự án cần câu chuyện mới. Là nhà đầu tư, bạn phải tự hỏi: VulcanBench ở đâu? Mã nguồn ở đâu? Nếu không có câu trả lời, đó là một cái bẫy.
--- Bài viết thể hiện quan điểm cá nhân của tác giả dựa trên phân tích kỹ thuật. Không phải lời khuyên đầu tư.