Nhận định số

DeepSeek-V4.1-Flash ra mắt: Kiến trúc CED 40 layer, giảm 4 lần KV Cache

Tóm tắt nhanh

  • Kiến trúc Causal Encoder-Decoder (CED): Thiết kế 40 layer tách biệt khâu đọc hiểu prompt (20 layer encoder) và sinh phản hồi (20 layer decoder), tối ưu tài nguyên kích hoạt.
  • Đột phá bộ đệm KV Cache: Giảm xấp xỉ 4 lần dung lượng KV Cache so với V4-Flash và giảm tới 437 lần so với V1 nhờ kỹ thuật CSA2 và định dạng nén FP4.
  • Quy mô và ngữ cảnh cực khủng: Tổng 552 tỷ tham số (MoE), hỗ trợ cửa sổ ngữ cảnh mở rộng tối đa lên đến 1 triệu token.
  • Hiệu năng benchmark ấn tượng: Đạt 74,2% trên DeepSWE v1.1, vượt qua Claude Opus 5.0 và GPT-5.6 Sol ở tác vụ giải quyết vấn đề kỹ thuật chuyên sâu.

DeepSeek vừa chính thức công bố mô hình DeepSeek-V4.1-Flash với tổng cộng 552 tỷ tham số (552B) theo kiến trúc Mixture-of-Experts (MoE) đa phương thức, hỗ trợ ngữ cảnh tối đa lên đến 1 triệu token. Điểm đột phá lớn nhất của bản cập nhật lần này nằm ở việc giải quyết triệt để nút thắt tài nguyên bộ nhớ KV Cache – một trong những gánh nặng chi phí lớn nhất khi vận hành các mô hình ngôn ngữ lớn phục vụ tác vụ AI Agent kéo dài.

Kiến trúc Causal Encoder-Decoder: Tách biệt đọc prompt và sinh phản hồi

Sơ đồ phân chia encoder và decoder kiến trúc CED

Khác với thiết kế Transformer truyền thống vốn sử dụng chung toàn bộ trọng lượng cho cả quá trình đọc hiểu văn bản đầu vào (prefill) lẫn xuất câu trả lời (decode), DeepSeek-V4.1-Flash ứng dụng kiến trúc Causal Encoder-Decoder (CED) gồm 40 layer. Trong đó, 20 layer causal encoder đầu tiên chịu trách nhiệm xử lý ngữ cảnh với chỉ 8 tỷ tham số kích hoạt (8B), trong khi 20 layer decoder tiếp theo đảm nhận việc sinh phản hồi với 16 tỷ tham số kích hoạt (16B).

Bộ đệm KV Cache toàn cục của khối decoder không phải tính toán riêng lẻ ở từng layer decoder mà được chiếu trực tiếp từ trạng thái ẩn cuối cùng của encoder. Cơ chế này kết hợp cùng giải pháp SWA Bounded Replay giúp hệ thống tái tạo trạng thái cửa sổ trượt (SWA) bằng cách chỉ chạy lại các token gần nhất thay vì phải lưu toàn bộ lên ổ cứng SSD, giảm dung lượng bộ đệm bền vững xuống còn khoảng 1/8 so với thế hệ DeepSeek-V4-Flash trước đó.

Tối ưu bộ đệm KV Cache với CSA2 và hiệu năng benchmark thực tế

Thông số nén bộ đệm KV Cache và các chế độ CSA2

Để nén không gian lưu trữ ngữ cảnh sâu hơn nữa, DeepSeek triển khai kỹ thuật Compressed Sparse Attention 2 (CSA2). Mỗi layer attention được gán một trong ba chế độ tĩnh gồm Full, Reindex hoặc Reuse nhằm chia sẻ KV chính và indexer K xuyên suốt các layer, đồng thời tái sử dụng các chỉ mục chú ý thưa Top-K.

Ở khối decoder, hệ thống bổ sung Hierarchical Sparse Indexer giúp khoanh vùng tìm kiếm ngữ cảnh sâu mà không làm bùng nổ chi phí tính toán theo độ dài ngữ cảnh. Kết hợp định dạng nén FP4 (chuẩn E2M1, một hệ số tỉ lệ E4M3 cho mỗi 16 kênh), dung lượng KV Cache toàn cục giảm xuống chỉ còn 890 byte cho mỗi token – đạt mức thu nhỏ xấp xỉ 4 lần so với V4-Flash và giảm tới 437 lần so với DeepSeek-V1 đời đầu.

Về mặt hiệu năng, ở mức thiết lập suy luận tối đa (reasoning_effort=100), DeepSeek-V4.1-Flash đạt 74,2% độ chính xác giải quyết vấn đề trên bài kiểm tra DeepSWE v1.1, nhỉnh hơn Claude Opus 5.0 (74,0%) và GPT-5.6 Sol (73,0%). Trên bài test bảo mật CyberGym, mô hình ghi nhận điểm Pass@1 đạt 88,1%, đồng thời đạt rating 3471 trên bảng xếp hạng thuật toán Codeforces, khẳng định năng lực tối ưu vượt trội cho các tác vụ kỹ thuật chuyên sâu.

THEO DÕI CÁC KÊNH CỦA TEKCAFE

BÀI VIẾT MỚI NHẤT