Giải thích

Gemini 4 Argon: bước nhảy 1 triệu token có giúp AI agent làm việc dài hơi hơn?

Gemini 4 Argon tăng giới hạn đầu ra lên một triệu token, nhưng giá trị thực nằm ở khả năng duy trì công việc nhiều bước. Cách Google giới hạn quyền truy cập cũng cho thấy năng lực an ninh mạng đang trở thành bài toán phát hành sản phẩm.

Tóm tắt nhanh

  • Gemini 4 Argon nâng trần đầu ra lên 1 triệu token, từ 64.000 token ở thế hệ trước theo Google.
  • Điểm đáng chú ý không chỉ là câu trả lời dài hơn, mà là khả năng để agent xử lý một chuỗi việc nhiều bước mà ít phải dừng giữa chừng.
  • Google đang thử nghiệm với nhóm chuyên gia phòng thủ mạng trước khi mở rộng cho khách hàng API trả phí và thuê bao Google AI Ultra.
  • Các kết quả benchmark và ví dụ nội bộ hiện do Google công bố; chúng chưa thay thế đánh giá độc lập trong điều kiện sử dụng thực tế.

Một triệu token đầu ra nhắm vào công việc kéo dài, không phải câu trả lời dài

Nhận diện Gemini 4 Argon với tên mô hình và số 4 trên nền xanh
Chữ Gemini 4 Argon nằm cạnh số 4 trắng lớn trên nền xanh chuyển sắc.

Gemini 4 Argon gây chú ý vì giới hạn đầu ra một triệu token, gấp hơn 15 lần mức 64.000 token mà Google gọi là giới hạn trước đó. Cần phân biệt con số này với cửa sổ ngữ cảnh đầu vào: output token là lượng nội dung mô hình có thể sinh ra, không tự động cho biết nó đọc được bao nhiêu tài liệu trong một lần.

Với một AI agent, đầu ra lớn có thể hữu ích khi hệ thống phải lập kế hoạch, kiểm tra kết quả, sửa lỗi rồi tiếp tục qua nhiều vòng. Nếu mỗi chặng đều bị cắt vì chạm trần sinh văn bản, quy trình dễ phải chia nhỏ và ghép lại; giới hạn cao hơn tạo thêm khoảng trống cho chuỗi xử lý liền mạch. Tuy vậy, một triệu token là mức trần kỹ thuật, không phải lời bảo đảm rằng mọi tác vụ dài đều chính xác, nhanh hoặc rẻ hơn.

Chi phí cũng cần được tính theo lượng token thực dùng. Google công bố giá giới thiệu 2 USD cho một triệu token đầu vào và 10 USD cho một triệu token đầu ra; token đầu vào được lưu đệm giảm 95% so với giá đầu vào. Sau giai đoạn giới thiệu, mức giá dự kiến là 4 USD và 20 USD tương ứng. Với tác vụ tạo đầu ra rất dài, phần chi phí đầu ra có thể trở thành khoản đáng kể dù đơn giá trên mỗi triệu token trông thấp.

Ví dụ tại Google cho thấy agent có thể tạo giá trị ở khâu kỹ thuật lặp lại

Google cho biết Argon đang được dùng trong các công việc nội bộ, từ gỡ lỗi đến chuyển đổi mã quy mô lớn. Một ví dụ cụ thể là libgav1: các agent của hãng thay thế 32.000 dòng SIMD trong bản Rust bằng mã Rust an toàn, sau nhiều vòng thử nghiệm có hướng dẫn từ hồ sơ hiệu năng. Google nói bộ giải mã video này chạy nhanh hơn 2,7 lần so với bản Rust trước đó và cho đầu ra video giống hệt.

Đây không phải bằng chứng rằng có thể giao một đợt viết lại hệ thống cho mô hình rồi đưa thẳng vào sản xuất. Chính Google nói các thay đổi trên những hệ thống quan trọng vẫn phải qua kiểm toán tự động lẫn thủ công, kiểm thử mô phỏng và rà soát. Điểm thực tế hơn là agent có thể đảm nhận phần thử nghiệm lặp lại — đo, xem đầu ra trình biên dịch, điều chỉnh mã — trong khi quy trình xác minh vẫn là điều kiện bắt buộc.

Hãng còn cho biết một nhóm agent phân tích dữ liệu đo đạc trên các trung tâm dữ liệu và giải phóng hơn 300 TiB bộ nhớ sau khi triển khai các tối ưu hóa; ước tính tổng mức tiết kiệm có thể đạt 500 TiB đến 1 PiB. Đây là tuyên bố về kết quả nội bộ của Google, chưa phải phép đo độc lập. Dù vậy, nó làm rõ nơi năng lực agent có thể đáng tiền: các hệ thống lớn có dữ liệu vận hành dồi dào và nhiều thao tác tối ưu hóa nhỏ mà con người khó kiểm tra thủ công trên toàn bộ hạ tầng.

Benchmark cao là tín hiệu ban đầu, chưa trả lời được chi phí triển khai

Biểu đồ Vals Index so sánh điểm tổng hợp của Gemini 4 Argon và các mô hình AI khác
Biểu đồ Vals Index cho thấy Argon đứng sau một số mô hình ở chỉ số tổng hợp này, nhắc rằng điểm benchmark thay đổi theo loại công việc được đo.

Trên DeepSWE v1.1, bài đo các tác vụ kỹ thuật phần mềm nhiều bước trong tình huống thực tế, Google báo Argon đạt 77,9%. Hãng cũng công bố 51,3% trên AutomationBench và 91,7% trên LVBench về hiểu video dài. Các con số này gợi ý mô hình được nhắm tới công việc kéo dài và liên miền, nhưng mỗi benchmark chỉ phản ánh cách thiết kế bài kiểm tra, tập dữ liệu và tiêu chí chấm tương ứng.

Riêng DeepSWE, mức điểm cao không nói hết một nhóm kỹ thuật sẽ mất bao lâu để hoàn tất một nhiệm vụ, cần bao nhiêu lần con người can thiệp, hay chi phí API trên mỗi thay đổi được chấp nhận. Đó mới là các chỉ số quyết định liệu agent có thể vận hành kinh tế trong quy trình phát triển phần mềm hay không. Người dùng doanh nghiệp nên đợi thêm dữ liệu đánh giá độc lập về độ ổn định, khả năng lặp lại và chi phí toàn quy trình trước khi xem benchmark là lý do chuyển hệ thống.

Quyền truy cập hẹp phản ánh rủi ro kép của AI an ninh mạng

Kết quả Gemini 4 Argon trên đánh giá Gray Swan IPI về prompt injection gián tiếp
Biểu đồ Gray Swan IPI cho thấy tỷ lệ thành công của tấn công prompt injection gián tiếp trong phép thử Google công bố; thấp hơn là tốt hơn.

Google đang phát hành Argon trước cho một nhóm chuyên gia phòng thủ mạng được chọn qua chương trình Fairwind, đồng thời cho biết sẽ mở rộng dần sau khi tiếp tục hoàn thiện các biện pháp bảo vệ. Hãng nói mô hình có thể tự tìm, xác thực và vá lỗ hổng; nhóm phòng thủ tin cậy và đội nội bộ được dùng phiên bản không có một số rào chắn an ninh mạng để khai thác năng lực phòng thủ.

Cách triển khai này có lý do kỹ thuật: cùng một năng lực phân tích mã và tìm điểm yếu có thể giúp đội bảo mật vá phần mềm, nhưng cũng có thể bị lạm dụng để dò tìm lỗ hổng. Theo Google, Argon đồng hạng đầu trên CWE-bench v1 với 68%, nhưng đây vẫn là kết quả do hãng nêu và không đủ để kết luận mô hình an toàn trong mọi môi trường. Việc giới hạn người dùng ban đầu là một phần của cách kiểm soát rủi ro, không phải chứng minh rằng rủi ro đã được giải quyết.

Google cũng mô tả các biện pháp chống yêu cầu gây hại, chống prompt injection gián tiếp, theo dõi dấu hiệu lệch mục tiêu và cô lập môi trường thử nghiệm. Những lớp bảo vệ này đáng quan tâm bởi agent có thể thực hiện hành động nối tiếp thay vì chỉ trả lời bằng văn bản. Một sai lệch nhỏ trong quyền truy cập hoặc nội dung đầu vào có thể lan sang nhiều bước, nên năng lực sandbox và khả năng dừng tác vụ quan trọng không kém điểm benchmark.

Người dùng Việt Nam chưa cần đổi công cụ chỉ vì con số một triệu

Google dự kiến mở rộng Argon cho khách hàng API trả phí và người đăng ký Google AI Ultra sau giai đoạn thử nghiệm với nhóm chuyên gia. Tại thời điểm công bố, quyền truy cập rộng chưa mở; giá bằng USD là mức công bố cho dịch vụ, không phải giá bán lẻ tại Việt Nam hay cam kết về mức phí cuối cùng cho từng tài khoản.

Với lập trình viên và doanh nghiệp Việt Nam, yếu tố cần theo dõi là quyền truy cập thực tế, độ trễ, dữ liệu được gửi đi đâu, điều khoản sử dụng và tổng chi phí khi chạy tác vụ dài. Nếu công việc hiện tại chủ yếu hỏi đáp ngắn hoặc hỗ trợ viết mã từng đoạn, trần đầu ra cao có thể không tạo khác biệt tương xứng. Argon đáng thử khi tác vụ cần nhiều bước nối tiếp và đội triển khai có cách kiểm chứng đầu ra, giới hạn quyền hành động của agent.

Giá trị của Gemini 4 Argon vì vậy chưa nằm ở việc mô hình có thể sinh ra một triệu token trong một lần. Thử thách là chứng minh rằng nó xử lý được quy trình dài với ít lỗi và chi phí hợp lý — trong khi các rào chắn đủ chặt để năng lực an ninh mạng không biến thành rủi ro vận hành.

Nguồn tham khảo: Google Blog; 9to5Google; The Verge

Bài viết mới nhất