DeepSeek chậm một năm, giờ mới bắt kịp

Admin

23/08/2026 21:00

Sau nhiều tháng chỉ xử lý được văn bản, DeepSeek đã có model API đọc hiểu được hình ảnh, mở đường cho các tác vụ AI Agent phức tạp hơn.

DeepSeek vừa đưa lên API model đa phương thức đầu tiên thực sự dùng được cho developer, tên DeepSeek-V4-Flash-Vision-Exp, ra mắt ngày 21/8. Đây là bản mở rộng thị giác của DeepSeek-V4-Flash, model nhẹ và nhanh trong cặp đôi V4-Flash/V4-Pro mà hãng công bố hồi tháng 4. Model mới vẫn giữ được khả năng xử lý văn bản, lập luận và kiến thức tổng quát của bản gốc, đồng thời thêm khả năng đọc hiểu ảnh.

DeepSeek chậm một năm, giờ mới bắt kịp- Ảnh 1.

Trước đó, DeepSeek là một trong số ít lab hàng đầu chưa có API đa phương thức công khai, trong khi GPT, Gemini và Claude đều đã có từ lâu. Sức ép buộc hãng phải vá gấp đến từ chính công cụ của mình: DeepSeek Harness, framework AI Agent mã nguồn mở ra mắt ngày 13/8, đạt hơn 160.000 star trên GitHub chỉ sau 6 ngày, tốc độ hiếm gặp với một công cụ dành cho lập trình viên. Nhưng framework này sớm gặp bế tắc. Đến ngày 19/8, bản cập nhật Harness rc.8 đã mở sẵn luồng nhận ảnh để Agent đọc ảnh chụp màn hình, giao diện hay lỗi terminal, trong khi model đứng sau nó lại chưa hiểu được ảnh. Vision-Exp ra đời hai ngày sau đó, đúng lúc vá lại lỗ hổng này.

Về hiệu năng, DeepSeek công bố Vision-Exp giữ được điểm số gần tương đương bản text-only ở các bài đo văn bản thuần, trong khi ở các bài đo Agent cần hiểu ảnh, model có bước nhảy đáng kể. Trên ApexBench, điểm từ 26,2 (khi model text-only buộc phải bỏ qua phần ảnh) tăng lên 36,5, dù vẫn thấp hơn Claude Opus 4.8 của Anthropic (39,4 điểm). Ở hai bài đo khác là Agents' Last Exam và ZeroBench, Vision-Exp thậm chí nhỉnh hơn Opus 4.8. Cần lưu ý đây là số liệu DeepSeek tự đo bằng framework của chính hãng, chưa có bên thứ ba kiểm chứng độc lập.

DeepSeek chậm một năm, giờ mới bắt kịp- Ảnh 2.

Về giá, ảnh được quy đổi thành token để tính phí, tối đa 384 token mỗi ảnh, áp mức giá y hệt model text V4-Flash. Tính theo giờ cao điểm, xử lý một ảnh tốn khoảng 0,0011 tệ, tương đương chưa tới 5 đồng theo tỷ giá Vietcombank hiện tại (khoảng 3.900 đồng một tệ). Mức giá này vẫn thấp hơn rõ rệt so với các đối thủ cùng phân khúc như GPT-5.6 Luna hay Gemini Flash-Lite, vốn thường tính phí riêng cho phần xử lý ảnh thay vì gộp vào cùng giá token văn bản như DeepSeek.

Với cộng đồng lập trình viên Việt Nam, DeepSeek từ lâu đã là lựa chọn quen thuộc nhờ giá rẻ hơn hẳn các model Mỹ. Việc bổ sung khả năng đọc ảnh giúp các ứng dụng nội địa dùng DeepSeek API, từ chatbot chăm sóc khách hàng đến công cụ tự động hoá quy trình văn phòng, có thêm lựa chọn xử lý ảnh mà không phải chuyển sang nhà cung cấp khác với chi phí cao hơn.

DeepSeek hiện gắn nhãn "Exp" (thực nghiệm) cho model này, chưa cam kết thời điểm đưa vào danh sách chính thức. Developer có thể truy cập ngay bằng cách đặt tham số model thành deepseek-v4-flash-vision-exp trên nền tảng API.

Bạn đang đọc bài viết "DeepSeek chậm một năm, giờ mới bắt kịp" tại chuyên mục Công nghệ - Xe. Mọi bài vở cộng tác xin gửi về địa chỉ email ([email protected]).