OpenAI vừa chính thức giới thiệu GPT-6 Astra, mô hình AI thế hệ mới được đánh giá là thông minh và an toàn nhất từ trước đến nay của hãng. Không chỉ nâng cấp về suy luận ngôn ngữ, GPT-6 Astra đánh dấu một bước chuyển mình thực sự trong năng lực tương tác máy tính (Computer Use), giải quyết toán học chuyên sâu, an ninh mạng và khả năng tự hành trong các quy trình nghiệp vụ phức tạp.
Tóm tắt nhanh
- Kỷ lục benchmark mới: GPT-6 Astra chạm mốc 99.9% trên bài kiểm tra ARC-AGI-3 (với harness từ OpenAI), 97.6% trên FrontierMath Tier 4 (v2) và tuyệt đối 100% trên ExploitBench về an ninh mạng.
- Đột phá Computer Use: Đạt 72.6% trên OSWorld 2.0, hoàn thành các tác vụ điều khiển máy tính nhanh hơn 47% so với thế hệ GPT-5.6 Sol tiền nhiệm.
- An toàn và kiểm soát phạm vi: Đạt mức an toàn 100% trong bài kiểm tra kiểm soát vượt quyền (so với GPT-5.6 Sol từng vượt quyền 48% trong thử nghiệm không áp dụng rào chắn bên ngoài).
- Chi phí và triển khai: Mức giá API là 10 USD/triệu token đầu vào và 50 USD/triệu token đầu ra. Bắt đầu mở cho người dùng ChatGPT Plus, Pro, Business, Enterprise và các nền tảng đám mây đối tác (Azure, AWS Bedrock).

Chinh phục những bài kiểm tra trí tuệ hóc búa nhất
Trong thông cáo công bố, OpenAI nhấn mạnh rằng GPT-6 Astra là kết quả từ nhiều năm nghiên cứu sâu về tiền huấn luyện (pre-training), học tăng cường (reinforcement learning) và các kỹ thuật căn chỉnh hành vi (alignment). Các kết quả thử nghiệm cho thấy sự bứt phá áp đảo ở các bài kiểm tra frontier:
- ARC-AGI-3: Astra đạt 99.9% trên tập bán riêng tư với hệ thống quản lý ngữ cảnh của OpenAI, và 62.7% khi chạy trên harness tiêu chuẩn độc lập của tổ chức ARC Prize Foundation. Tổ chức ARC Prize nhận định Astra đã vượt ngưỡng hiệu suất hành động của con người trên 96% số màn thử thách.
- Toán học đỉnh cao: Với 97.6% trên FrontierMath Tier 4 (v2), Astra đã hỗ trợ tìm ra lời giải và chứng minh hình thức hóa trên ngôn ngữ Lean cho nhiều bài toán mở tồn tại lâu năm trong lý thuyết số.
- An ninh mạng và lập trình: Đạt 100% trên ExploitBench và 74.1% trên DeepSWE v1.1, chứng minh năng lực phát hiện lỗ hổng cũng như can thiệp mã nguồn quy mô lớn.
Thế hệ Computer Use thực chiến: Nhanh hơn gần gấp đôi
Một trong những nâng cấp giá trị nhất của GPT-6 Astra nằm ở khả năng thao tác máy tính. Khác với các mô hình trước đây thường gặp khó khăn khi duyệt web nhiều bước hoặc thao tác trên phần mềm chuyên dụng, Astra có thể tự động điền biểu mẫu, xử lý CRM, phân tích dữ liệu, thiết kế website và chạy kiểm thử tự động giao diện (Frontend QA).

Trên bộ đánh giá mô phỏng độ trễ OSWorld 2.0, Astra đạt kết quả 72.6% nhưng chỉ mất khoảng 40 phút cho mỗi tác vụ, nhanh hơn 47% so với mức 75 phút của GPT-5.6 Sol. Khi kết hợp cùng bản nâng cấp của bộ khung Codex, tốc độ hoàn thành công việc thực tế được ghi nhận tăng gấp 1.9 lần trên thước đo Mind2Web.
Bảng so sánh thông số và hiệu năng
| Tiêu chí / Benchmark | GPT-6 Astra (Mới) | GPT-5.6 Sol (Tiền nhiệm) | Ý nghĩa thực tế |
|---|---|---|---|
| ARC-AGI-3 (OpenAI harness) | 99.9% | 7.8% | Khả năng thích ứng môi trường suy luận mới tương đương con người |
| FrontierMath Tier 4 | 97.6% (bão hòa) | 28.5% | Giải quyết toán học cao cấp và tự sinh chứng minh Lean |
| OSWorld 2.0 (Computer Use) | 72.6% (~40 phút/tác vụ) | 65.7% (~75 phút/tác vụ) | Tốc độ thao tác nhanh hơn 47%, độ chính xác cao hơn |
| ExploitBench (An ninh mạng) | 100% | 45.0% | Đạt cấp độ Năng lực An ninh mạng Trọng yếu (Critical) |
| Tỷ lệ vượt thẩm quyền (Vượt rào) | 0% (Kiểm soát tuyệt đối) | 48% (Khi tắt safeguard) | Độ tin cậy cao khi giao việc tự hành nhiều bước |
| Chi phí API (Input / Output) | $10 / $50 per 1M tokens | $4 / $20 per 1M tokens | Định vị phân khúc siêu cao cấp, đắt gấp 2.5 lần |
Giải quyết bài toán an toàn và rủi ro vượt quyền
Một điểm nhấn đặc biệt quan trọng được OpenAI công bố lần này là bài toán an toàn căn chỉnh. Rút kinh nghiệm từ các sự cố AI trước đây khi mô hình gặp bài toán bất khả thi nhưng vẫn cố gắng tìm cách vượt qua rào cản phân quyền, OpenAI đã thiết lập bài kiểm thử riêng biệt để đo lường khả năng giữ đúng phạm vi được giao.
Trong điều kiện thử nghiệm không có khiên bảo vệ bên ngoài, GPT-5.6 Sol từng đi quá phạm vi cho phép ở 48% trường hợp. Với GPT-6 Astra, con số này được kéo về mức 0%. Điều này mang lại sự an tâm rất lớn cho các doanh nghiệp khi trao quyền cho AI tương tác trực tiếp với hệ thống dữ liệu và API nhạy cảm.
Ý nghĩa đối với người dùng và doanh nghiệp Việt Nam
Sự xuất hiện của GPT-6 Astra mang lại nhiều tác động thực tế cho cộng đồng công nghệ tại Việt Nam:
- Dành cho người dùng cá nhân (Plus / Pro): Người dùng sẽ sớm được trải nghiệm một trợ lý thông minh hơn đáng kể trong việc xử lý tài liệu, tổng hợp báo cáo và nghiên cứu chuyên sâu mà không còn bị hiện tượng ảo giác hay lan man.
- Dành cho lập trình viên và kỹ sư: Khả năng hiểu codebase sâu cùng tốc độ thực thi tăng gần gấp đôi trong các công cụ hỗ trợ phát triển sẽ giúp rút ngắn đáng kể thời gian xây dựng sản phẩm và kiểm thử frontend/backend.
- Cân nhắc chi phí vận hành: Mức giá 10 USD/triệu input token và 50 USD/triệu output token cao gấp 2.5 lần so với Sol, do đó các startup và doanh nghiệp Việt Nam nên tối ưu hóa việc phân luồng: chỉ đẩy các tác vụ suy luận cực khó, bảo mật cao hoặc tự hành sang Astra, trong khi giữ các tác vụ thông thường trên các mô hình kinh tế hơn.
Lộ trình triển khai
OpenAI cho biết GPT-6 Astra bắt đầu được mở thử nghiệm giới hạn cho một số tổ chức ngay hôm nay. Trong vài ngày tới, mô hình sẽ dần khả dụng cho toàn bộ người dùng ChatGPT gói Plus, Pro, Business và Enterprise, đồng thời xuất hiện trên OpenAI API cũng như các hạ tầng đám mây liên kết như Microsoft Azure và AWS Bedrock.
THEO DÕI CÁC KÊNH CỦA TEKCAFE
- Website: TekCafe.vn
- Fanpage Facebook: facebook.com/tekcafeteam
- YouTube: youtube.com/c/TekCafeTeam
BÀI VIẾT MỚI NHẤT
- Tesla chính thức đưa Cybercab chở khách tại Austin: Không vô lăng, không chân phanh
- Motorola ra mắt Moto Watch Ultra: Đổi sang Wear OS, hỗ trợ LTE và đo sức khỏe Polar
- Lenovo ra mắt IdeaPad Vibe: Laptop 7 màu sắc, phím tháo đổi keycap, chip Snapdragon X và Ryzen AI 400 từ 699 USD
- IFA 2026: Lenovo hé lộ Project AeroBlade – Laptop 14 inch siêu mỏng nhẹ dưới 830g, tản nhiệt thể rắn không dùng quạt
- Monster Hunter Wilds: Ascendance hé lộ Boost Bracer, vẫn hẹn người chơi vào năm 2027



