Tóm tắt nhanh
- Engadget nhận xét ChatGPT Voice nghe biểu cảm hơn Gemini Live, nhưng đó là trải nghiệm của tác giả, không phải phép đo khách quan.
- Google giới thiệu Gemini 3.8 Live với xử lý hình ảnh gần thời gian thực và chuyển đổi giữa 97 ngôn ngữ; thông số của mô hình không tự chứng minh mọi phiên trò chuyện trong ứng dụng đều dùng đúng mô hình ấy.
- OpenAI công bố giới hạn Voice theo chu kỳ 24 giờ: Go dùng GPT-Live-1 mini trong 3 giờ, Plus dùng GPT-Live-1 trong 3 giờ.
- Nếu cần đưa camera vào cuộc trò chuyện, hãy kiểm tra quyền truy cập và giới hạn hiện tại trong ứng dụng trước khi trả tiền: giá và tính năng có thể khác theo thị trường.
Một trợ lý nói chuyện giống người chưa chắc là trợ lý trả lời đúng lúc bạn hỏi về thông tin vừa thay đổi. So sánh Gemini Live với ChatGPT Voice vì thế nên tách hai câu hỏi: giọng nghe có tự nhiên không, và cuộc đối thoại có giúp hoàn thành việc cần làm không. Đây là phân tích từ tài liệu của Google, OpenAI và trải nghiệm được Engadget công bố, không phải thử nghiệm trực tiếp của TekCafe.
Giọng biểu cảm là lợi thế của ChatGPT, nhưng độ tin cậy là câu chuyện khác

Trong bài so sánh của mình, tác giả Engadget thấy ChatGPT Voice dùng tiếng đệm và nhịp ngắt câu giống lời nói đời thường hơn, còn Gemini Live có ngữ điệu đều hơn. Đó là nhận xét nghe bằng tai trong một trải nghiệm cụ thể, không đủ để kết luận một dịch vụ sẽ tự nhiên hơn ở mọi giọng nói, ngôn ngữ và tình huống.
Tác giả cũng kể một trường hợp ChatGPT tra web trước khi trả lời về bản cập nhật mới, trong khi Gemini trả lời theo kiến thức sẵn có và sai. Bài học thực dụng không phải ChatGPT luôn chính xác hơn: với câu hỏi cần dữ liệu mới, người dùng nên yêu cầu kiểm tra nguồn và mở liên kết gốc. Một giọng nói trôi chảy có thể khiến câu trả lời sai nghe rất thuyết phục.
Khả năng nhìn qua camera và duy trì mạch nói mới là thước đo hữu ích

Google công bố Gemini 3.8 Live Extended Thinking đứng đầu chỉ số Speech to Speech Quality Index của Artificial Analysis với 82,6 điểm. Đây là kết quả hãng dẫn lại cho mô hình Extended Thinking, không phải phép so trực tiếp với ChatGPT Voice trong ứng dụng. Google cũng công bố Gemini 3.8 Live có thể xử lý đầu vào hình ảnh gần thời gian thực, chuyển giữa 97 ngôn ngữ và gọi công cụ trong lúc tiếp tục hội thoại. Đây là năng lực Google mô tả cho dòng mô hình, không phải lời bảo đảm rằng mỗi tài khoản Gemini Live đều có mọi tính năng và hạn mức như nhau. Người dùng cần phân biệt thông báo dành cho nhà phát triển với quyền sử dụng trong ứng dụng.
Nếu muốn hỏi về một vật trước camera, khả năng cho AI xem hình ngay trong lúc nói có giá trị hơn một câu trả lời đọc lên thật biểu cảm. Engadget cho biết tính năng camera tương đương của Gemini Live có thể dùng miễn phí trong giới hạn, còn camera khi gọi Voice của ChatGPT gắn với gói trả phí cao hơn vào thời điểm họ so sánh. Quyền truy cập có thể đổi; hãy xem màn hình nâng cấp của chính tài khoản thay vì coi mức giá USD ở thị trường khác là giá tại Việt Nam.
Chọn theo dữ liệu cần truy cập, không chỉ theo giọng đọc

Tài liệu OpenAI hiện liệt kê Voice của gói Go là 3 giờ với GPT-Live-1 mini và Plus là 3 giờ với GPT-Live-1, tính theo chu kỳ 24 giờ; Free được truy cập giới hạn và giới hạn có thể thay đổi. Hai mức ba giờ không tương đương về mô hình. Nếu sử dụng giọng nói thường xuyên, nên đối chiếu loại mô hình và hạn mức hiển thị trong tài khoản trước khi nâng cấp.
Gemini có lợi thế tiềm năng khi công việc nằm trong các dịch vụ Google, nhưng quyền kết nối dữ liệu cá nhân phải do người dùng cho phép và kiểm tra. Ngược lại, nếu ưu tiên chất giọng biểu cảm để trò chuyện hoặc luyện nói, nhận xét của Engadget là một điểm tham khảo nghiêng về ChatGPT. Với người dùng tại Việt Nam, nên thử cùng một câu hỏi tiếng Việt trên cả hai ứng dụng, rồi kiểm tra lại câu trả lời cần thông tin mới; không nên trả phí chỉ dựa trên một đoạn demo tiếng Anh.







