Phần mềm

Watermark ẩn của ChatGPT: hữu ích để truy dấu, chưa đủ để kết luận ai viết

Công nghệ textGrain gắn watermark ẩn vào văn bản ChatGPT tại EU, nhưng tín hiệu suy giảm nhanh khi chỉnh sửa và không thể xác định danh tính tác giả.

Tóm tắt nhanh

  • Kế hoạch tích hợp watermark thống kê ẩn vào văn bản ChatGPT và Codex tại EU bắt đầu triển khai theo từng giai đoạn.
  • Khách hàng API toàn cầu có thể tự bật trên một số mô hình; mặc định tính năng này tắt.
  • Ở ngưỡng dương tính giả mục tiêu 1%, công cụ nhận diện khoảng 80% đoạn 200 token và 95% đoạn 400 token thuộc nhóm nội dung tâm lý; toán học khó nhận diện hơn.
  • Thông báo hiện không áp dụng lộ trình tự động cho người dùng ChatGPT tại Việt Nam.

OpenAI công bố giải pháp textGrain ngày 5/10/2026 trong kế hoạch đáp ứng yêu cầu minh bạch của Đạo luật AI EU. Điểm đáng bàn không phải một máy dò có thể đóng dấu “AI viết”, mà là giới hạn thực tế của tín hiệu này: nó có thể giúp nhận ra một số văn bản chưa bị can thiệp nhiều, nhưng không chứng minh ai là tác giả hay nội dung có chính xác hay không.

textGrain ẩn tín hiệu trong cách chọn từ, không chèn ký tự lạ

Hình minh họa cơ chế đóng dấu văn bản ẩn textGrain theo Đạo luật AI EU
Kế hoạch tích hợp watermark ẩn textGrain vào nội dung văn bản nhằm đáp ứng quy chuẩn minh bạch của Đạo luật AI EU.

Watermark không phải chuỗi ký tự trắng hay metadata gắn vào file. Về bản chất kỹ thuật, textGrain tạo tín hiệu thống kê trong lựa chọn từ của mô hình ngôn ngữ; công cụ đối chiếu cần tìm mẫu phân phối đó trong đoạn văn. Vì vậy văn bản vẫn đọc bình thường, nhưng khả năng nhận diện phụ thuộc vào độ dài và mức độ tự do khi chọn từ.

Đây cũng là khác biệt quan trọng với dấu vết nằm trong metadata: sao chép nội dung sang tài liệu khác không nhất thiết xóa được tín hiệu thống kê, nhưng biên tập câu chữ sẽ làm tín hiệu suy yếu. Đơn vị phát triển cho biết công cụ phát hiện ban đầu chỉ cấp quyền cho các nhà nghiên cứu và tổ chức chuyên môn được duyệt theo từng trường hợp, thay vì mở tự do để kiểm tra văn bản công khai.

Tín hiệu giảm nhanh khi người dùng sửa câu chữ

Ở ngưỡng dương tính giả mục tiêu 1%, báo cáo kỹ thuật ghi nhận công cụ nhận diện khoảng 80% đoạn 200 token và 95% đoạn 400 token trong nội dung dạng văn xuôi tâm lý. Đây là kết quả trên một tập văn bản cụ thể, không phải cam kết rằng mọi văn bản có độ dài đó đều bị phát hiện. Với nội dung toán học, nơi lựa chọn từ ngữ và công thức bị giới hạn chặt chẽ, tỷ lệ phát hiện thấp hơn đáng kể.

Khả năng chống biên tập là điểm yếu rõ nhất: trên đoạn 400 token, thay 10% số từ bằng từ đồng nghĩa khiến mức phát hiện giảm từ khoảng 92% xuống 66%; thay 25% thì tỷ lệ nhận diện chỉ còn 17%. Nói cách khác, watermark hữu ích hơn như tín hiệu nghiên cứu ở quy mô tập hợp dữ liệu lớn, chứ không phải phép thử chắc chắn để kết luận một bài viết đơn lẻ đã qua tay AI.

Ngưỡng dương tính giả 1% cũng cần được hiểu đúng. Đây là chỉ số đo lường việc kiểm soát nguy cơ gắn nhầm tín hiệu trong điều kiện đánh giá chuẩn, không biến một kết quả phân tích thành bằng chứng độc lập về tác giả. Khi dùng kết quả này trong trường học, tuyển dụng hay kiểm duyệt, sai số và ngữ cảnh đều có thể gây hệ quả bất lợi cho người bị đánh giá.

Watermark không xác định tác giả, mức đóng góp hay độ đúng

Đặc tính kỹ thuật của textGrain không cho biết ai tạo văn bản, người dùng đã đóng góp bao nhiêu phần trăm ý tưởng, ai sở hữu nội dung, hay nội dung đúng hay sai. Công cụ chỉ đưa ra xác suất liệu đoạn văn có mang mẫu phân phối token đặc thù hay không; hệ thống không ghi nhận danh tính tài khoản, câu lệnh prompt hoặc lịch sử hội thoại.

Chiều ngược lại cũng tương tự: văn bản không xuất hiện watermark không đồng nghĩa với việc con người hoàn toàn tự viết. Đoạn trích quá ngắn, nội dung đã qua biên tập hoặc dịch thuật, dữ liệu tạo trước đợt phát hành, hay văn bản xuất phát từ mô hình khác đều có thể cho kết quả âm tính. Vì thế, dùng công cụ dò tìm đơn lẻ để quy kết trách nhiệm hay áp chế tài là đi quá phạm vi công nghệ.

Rollout ChatGPT giới hạn ở EU; API toàn cầu phải tự chọn bật

Ứng dụng ChatGPT hiển thị trên màn hình điện thoại thông minh
Ứng dụng ChatGPT trên điện thoại, dịch vụ nằm trong diện triển khai watermark ẩn theo từng giai đoạn tại khu vực EU.

Đợt triển khai diễn ra từng bước cho văn bản ChatGPT và Codex tại thị trường EU trong vài tuần tới, áp dụng trên mọi gói tài khoản tại khu vực này. Đây chưa phải thiết lập mặc định trên toàn cầu. Từ ngày 5/10/2026, khách hàng sử dụng API ở mọi nơi có thể chủ động bật thử nghiệm trên một số mô hình nhất định, nhưng mặc định vẫn tắt.

Với người dùng tại Việt Nam, lộ trình công bố chưa áp dụng tự động cho tài khoản ChatGPT hay Codex. Nếu một doanh nghiệp trong nước tích hợp qua API, việc bật watermark hoàn toàn phụ thuộc vào cấu hình chủ động của lập trình viên; không nên suy diễn rằng mọi văn bản tạo ra tại Việt Nam hiện nay đều đã bị gắn dấu ẩn.

Ảnh hưởng chất lượng cần được đọc từ nhiều phép thử

Thử nghiệm trên mô hình Astra cho thấy không có khác biệt hiệu năng đáng kể giữa văn bản có và không gắn watermark. Bảng số liệu đối chiếu dưới đây ghi nhận các phép đo chuẩn:

Phép thửKhông watermarkCó watermark
Artificial Analysis Intelligence Index (điểm)49.5749.76
AutomationBench (%)34.0934.86
DeepSWE v1.1 (%)72.8071.68
Terminal-Bench 4.0 (%)53.9056.06
Terminal-Bench Science 0.1 (%)56.9060.00
BrowseComp (%)87.9287.35
HealthBench Professional (%)64.2764.60
GPQA Diamond (%)94.4493.94

Số liệu: OpenAI công bố trên mô hình Astra.

Các kết quả dao động nhẹ đan xen giữa hai trạng thái, cho thấy việc điều chỉnh phân phối từ ngữ ở mức entropy thấp không làm giảm chất lượng suy luận. Dù vậy, người dùng vẫn cần kiểm chứng trên từng tác vụ chuyên biệt trước khi kết luận watermark hoàn toàn vô hại với độ chính xác chuyên sâu.

Watermark nên là một tín hiệu, không phải phán quyết

Tại Việt Nam, sự xuất hiện của textGrain đáng chú ý ở khía cạnh nhận thức công nghệ và tùy chọn API hơn là thay đổi thói quen sử dụng hàng ngày. Nếu cơ chế này được nhân rộng trong tương lai, các cơ sở giáo dục và doanh nghiệp nên xem nó như một kênh tham khảo hỗ trợ xác minh, tuyệt đối không dùng làm căn cứ duy nhất để kết luận hành vi gian lận.

Giá trị thực tế của watermark văn bản luôn gắn liền với giới hạn trước thao tác biên tập và dịch thuật. Việc hiểu rõ ranh giới kỹ thuật giúp người dùng tiếp cận công nghệ một cách thực tế, tránh tâm lý hoang mang hoặc phụ thuộc vào các công cụ dò tìm chưa hoàn thiện.

Nguồn tham khảo: OpenAI, Unite.AI, Trending Topics EU

Bài viết mới nhất