Thị trường

Claude Haiku 5.5 giảm mạnh chi phí API: lợi thế nằm ở các tác vụ chạy nền

Anthropic giảm giá Haiku 5.5 tới 90% ở mức niêm yết cho prompt dưới 100.000 token. Mô hình phù hợp làm worker xử lý việc lặp lại trong hệ thống AI, nhưng benchmark cho thấy chưa thể thay Sonnet hay Opus ở tác vụ phức tạp.

Tóm tắt nhanh

  • Claude Haiku 5.5 có giá 0,10 USD/triệu token đầu vào và 0,50 USD/triệu token đầu ra với prompt tối đa 100.000 token; Anthropic cho biết chi phí vận hành trung bình thấp hơn khoảng 75% so với Haiku 4.5.
  • Định vị hợp lý của Haiku 5.5 là worker xử lý việc hẹp, lặp lại hoặc chạy song song như phân loại, tóm tắt và hỗ trợ agent lớn.
  • Ở OSWorld 2.1, Haiku 5.5 đạt 72,4%, cao hơn Haiku 4.5 và GPT-6 Luna; nhưng ở Terminal-Bench 4.0, mô hình chỉ đạt 39,2%, kém xa Sonnet 5.5 và Opus 5.5.
  • Với lập trình viên và startup Việt Nam, mức giá thấp giúp thử nghiệm ứng dụng AI khối lượng lớn dễ hơn, nhưng cần tính cả độ chính xác, token cache, chi phí điều phối và bước kiểm tra đầu ra.

Claude Haiku 5.5 đáng chú ý không phải vì có thể thay thế mọi mô hình lớn, mà vì nó làm cho một kiểu kiến trúc AI nhiều tầng trở nên rẻ hơn: mô hình nhỏ xử lý phần việc thường ngày, còn Sonnet hoặc Opus chỉ nhận các trường hợp khó. Anthropic công bố mức giá đầu vào thấp hơn tới 90% ở nhóm prompt ngắn so với Haiku 4.5, trong khi đánh giá nội bộ cho thấy năng lực trên một số bài kiểm tra máy tính đã tăng rõ rệt.

Haiku 5.5 phù hợp làm worker hơn là bộ não duy nhất của ứng dụng

Ảnh giới thiệu Claude Haiku 5.5 của Anthropic
Ảnh giới thiệu chính thức của Claude Haiku 5.5, mô hình được định vị cho các tác vụ AI khối lượng lớn cần kiểm soát chi phí.

Trong một hệ thống dùng nhiều agent, phần tốn kém không nhất thiết là câu trả lời cuối cùng. Một agent có thể phải đọc tài liệu, chia nhỏ nội dung, phân loại yêu cầu, truy vấn dữ liệu hoặc rút gọn lịch sử trước khi mô hình chính bắt đầu suy luận. Nếu mỗi bước đều gọi mô hình lớn, chi phí tăng theo lượng công việc nền.

Hãng định vị Haiku 5.5 cho các tác vụ khối lượng cao và nhạy độ trễ như tóm tắt, nén ngữ cảnh, truy vấn cơ sở dữ liệu và phân loại. Hãng cũng gợi ý dùng Haiku làm subagent hỗ trợ Sonnet 5.5 hoặc Opus 5.5 trong công việc lập trình. Đây là hướng triển khai hợp lý: giao cho mô hình nhỏ những nhiệm vụ có đầu vào, đầu ra và tiêu chí kiểm tra rõ; đẩy lên mô hình mạnh hơn khi kết quả mơ hồ hoặc cần lập luận nhiều bước.

Điều đó không đồng nghĩa mọi ứng dụng đều tiết kiệm 75%. Con số 75% là mức giảm chi phí vận hành trung bình so với Haiku 4.5, không phải cam kết giảm tương ứng trên mọi pipeline. Tỷ lệ thực tế còn phụ thuộc lượng token đầu ra, prompt cache, số lượt sửa, tỷ lệ phải chuyển việc lên mô hình lớn và chi phí kiểm định kết quả.

Bảng giá rẻ nhất áp dụng cho prompt không quá 100.000 token

Giá theo triệu token cho thấy ranh giới ngữ cảnh ảnh hưởng đáng kể đến hóa đơn. Với Haiku 5.5, đơn giá của prompt trên 100.000 token cao gấp năm lần mức đầu vào và đầu ra áp dụng cho prompt ngắn.

Khoản phí (USD/triệu token)Haiku 5.5 (đến 100k token)Haiku 5.5 (trên 100k token)Haiku 4.5Sonnet 5.5
Đầu vào0,100,501,002,00
Đầu ra0,502,505,0010,00
Đọc cache0,010,050,100,10
Ghi cache0,1250,6251,252,50

Mức phí niêm yết trong bảng do hãng công bố. Mức giá thấp nhất chỉ phát huy đầy đủ khi tác vụ được thiết kế để giữ prompt trong ngưỡng 100.000 token; đưa nguyên tài liệu dài vào mỗi lượt có thể làm mất lợi thế. Với hệ thống agent, khâu cắt ngữ cảnh và tái sử dụng cache cũng quan trọng không kém việc chọn model.

Giá đọc cache của Sonnet 5.5 cũng được giảm 50% xuống 0,10 USD/triệu token. Hãng ước tính thay đổi này giúp phần lớn tác vụ agentic trên Sonnet rẻ hơn khoảng 20%. Đây là tín hiệu cho thấy cuộc cạnh tranh không chỉ xoay quanh giá token mới, mà còn quanh chi phí của những lượt lặp lại trong ứng dụng thực tế.

Benchmark cho thấy năng lực tăng, nhưng chưa xóa ranh giới giữa Haiku và Sonnet

Haiku 5.5 có bước tiến lớn ở bài kiểm tra điều khiển máy tính OSWorld 2.1, nhưng kết quả lập trình agentic vẫn cho thấy mô hình nhỏ không phải lựa chọn mặc định cho mọi việc. Bảng dưới đây tập trung vào hai phép thử có ý nghĩa khác nhau: thao tác máy tính nhiều bước và hoàn thành tác vụ dòng lệnh phức tạp.

Bài kiểm traHaiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5Opus 5.5
OSWorld 2.1, offline subset (%) — cao hơn tốt hơn72,415,748,983,9—
Terminal-Bench 4.0 (%) — cao hơn tốt hơn39,20,016,4—70,6

Số liệu: Anthropic. Haiku 5.5 vượt GPT-6 Luna trong OSWorld theo kết quả công bố, nhưng ở Terminal-Bench khoảng cách với Opus 5.5 vẫn lớn. Hai bài đo không đại diện cho toàn bộ chất lượng sản phẩm; chúng cho thấy nên chọn model theo loại nhiệm vụ, thay vì suy ra một thứ hạng chung từ một con số benchmark.

Haiku 5.5 cũng là model Haiku đầu tiên có mức effort tùy chỉnh. Tính năng này cho phép điều chỉnh mức độ suy luận để cân đối giữa chi phí và năng lực xử lý, với thiết lập mặc định ở mức trung bình (medium). Với tác vụ phân loại có tiêu chí rõ, mức xử lý vừa hoặc thấp có thể hợp lý. Với thao tác nhiều bước dễ gây lỗi, tăng effort có thể giúp nhưng cũng cần đo lại độ trễ và chi phí thay vì mặc định bật cao.

Ứng dụng tại Việt Nam nên thử bằng một luồng có thể đo được

Haiku 5.5 là dịch vụ API, không phải thiết bị bán lẻ; Mô hình hiện khả dụng trên Claude Platform và các nền tảng đám mây AWS, Google Cloud, Microsoft Azure. Vì vậy, câu hỏi với nhóm phát triển trong nước không phải chờ hàng về hay so giá cửa hàng, mà là liệu chất lượng tiếng Việt và độ ổn định có đạt ngưỡng cho quy trình cụ thể hay không.

Một điểm khởi đầu có kiểm soát là dùng model nhỏ để phân loại yêu cầu hỗ trợ, trích trường dữ liệu từ biểu mẫu hoặc tạo bản tóm tắt đầu vào cho nhân viên. Nên giữ lại tập mẫu tiếng Việt đã được gán nhãn, đo tỷ lệ sai và theo dõi số trường hợp phải chuyển sang mô hình lớn hoặc nhân viên. Nếu chỉ nhìn hóa đơn token mà bỏ qua chi phí sửa lỗi, mức tiết kiệm trên giấy có thể không chuyển thành tiết kiệm vận hành.

Với sản phẩm hướng người dùng, hệ thống nên có đường lui: khi model không chắc chắn, dữ liệu thiếu hoặc yêu cầu vượt phạm vi, chuyển lên model mạnh hơn hay người thật. Cách phân tầng này phù hợp hơn việc giao toàn bộ hội thoại cho Haiku chỉ vì đơn giá thấp.

Mức giá GPT-6 Luna cần được so theo cùng điều kiện

Ở mức niêm yết được công bố, Haiku 5.5 và GPT-6 Luna cùng có giá đầu vào 0,10 USD và đầu ra 0,50 USD/triệu token cho prompt dưới 100.000 token. Hai đơn giá bằng nhau chưa đủ để kết luận chi phí tương đương: ngưỡng ngữ cảnh, cache, giới hạn tốc độ, chất lượng trên dữ liệu tiếng Việt và tỷ lệ hoàn thành đúng đều làm thay đổi hóa đơn thực tế.

Do đó, mức giá ngang nhau nên được xem là điểm xuất phát cho thử nghiệm, không phải kết luận model nào rẻ hơn. Nhóm kỹ thuật có thể chạy cùng bộ tác vụ, cùng giới hạn đầu ra và cùng tiêu chí chấp nhận, sau đó tính tổng chi phí trên mỗi kết quả đúng. Đây mới là con số hữu ích khi chọn backend cho một sản phẩm đang phục vụ người dùng Việt Nam.

Chưa nên giao Haiku 5.5 toàn bộ tác vụ phức tạp

Haiku 5.5 hấp dẫn nhất ở các bước lặp lại, hẹp phạm vi và có thể kiểm tra tự động. Mức giá mới mở thêm dư địa để xử lý nhiều tài liệu hoặc yêu cầu hơn, còn tiến bộ ở OSWorld cho thấy dòng Haiku đã tiến xa hơn vai trò trả lời ngắn đơn giản. Nhưng benchmark Terminal-Bench vẫn nhắc rõ giới hạn: tác vụ lập trình nhiều bước cần năng lực cao hơn vẫn hợp với Sonnet hoặc Opus.

Với lập trình viên và startup Việt Nam, lựa chọn thực tế là đưa Haiku vào một nhánh công việc nhỏ, đo chất lượng trên dữ liệu tiếng Việt, rồi mới mở rộng. Nếu tỷ lệ phải gọi lại hoặc chuyển cấp cao quá lớn, giá token thấp ban đầu sẽ không đủ bù phần xử lý phát sinh. Dòng mô hình nhỏ đang trở nên đáng thử hơn; phần tiết kiệm thật sự phụ thuộc cách thiết kế hệ thống.

Nguồn tham khảo: Anthropic, VentureBeat, 9to5Mac.

Bài viết mới nhất