DeepSeek-V4-Flash chính thức ra mắt, tăng tốc cuộc đua tác tử AI với OpenAI

  • Người tạo chủ đề Người tạo chủ đề dogamer06
  • Ngày bắt đầu Ngày bắt đầu

dogamer06

Senior Member
DeepSeek vừa chính thức mở thử nghiệm công khai (public beta) API của mô hình DeepSeek-V4-Flash, đồng thời xác nhận phiên bản DeepSeek-V4-Pro hoàn chỉnh sẽ ra mắt vào đầu tháng 8.
Không chỉ tiếp tục duy trì lợi thế về chi phí thấp, DeepSeek còn tập trung nâng cấp mạnh khả năng tác tử AI, lĩnh vực đang được xem là "mặt trận" cạnh tranh quyết liệt nhất giữa các mô hình ngôn ngữ lớn. Động thái này diễn ra trong bối cảnh OpenAI vừa hạ giá mạnh nhiều dòng mô hình, cho thấy cuộc đua AI đang chuyển từ cạnh tranh về giá sang cạnh tranh về năng lực thực thi.

Trong các bài kiểm tra đánh giá tác tử AI, DeepSeek-V4-Flash đạt nhiều kết quả đáng chú ý.​

Ở bài kiểm tra Terminal Bench 2.1, mô hình đạt 82,7 điểm; Cybergym đạt 76,7 điểm; Toolathlon Verified đạt 70,3 điểm; trong khi các bài đánh giá về lập trình như DSBench-FullStack và DSBench-Hard lần lượt đạt 68,7 và 59,6 điểm.

Những kết quả này cho thấy khả năng sử dụng công cụ, tự động hóa quy trình và thực hiện các tác vụ lập trình của DeepSeek đã được cải thiện đáng kể so với thế hệ trước.

Trước đó, vào tháng 4, DeepSeek từng công bố hai phiên bản thử nghiệm gồm V4-Pro và V4-Flash.

Trong đó, V4-Pro hướng tới hiệu năng tối đa nhằm cạnh tranh trực tiếp với các mô hình thương mại hàng đầu như GPT hay Claude, còn V4-Flash được thiết kế với quy mô nhỏ hơn để giảm độ trễ và chi phí vận hành.

Theo đánh giá nội bộ của DeepSeek, phiên bản V4-Pro Preview đã nằm trong nhóm dẫn đầu các mô hình nguồn mở ở nhiều bài kiểm tra về tác tử AI và lập trình. Hiệu quả làm việc của mô hình được cho là đã tiệm cận Claude Opus 4.6 ở chế độ thông thường và đạt trình độ gần ngang các mô hình thương mại hàng đầu trong các bài toán toán học, STEM và lập trình phức tạp.
...
 
1785571184421.webp


Benchmark của bản chính thức so với bản Preview.
DeepSeek tung ra bản mới sau khi GPT kêu tối ưu hoá chi phí :shame:

 
Ủa tưởng con flash này ra lâu rồi mà ta, trước giờ toàn dùng v4 pro nên không để ý lắm, nhưng mà hình như có bản flash rồi mà
 
lỡ đâu nó lại benchmaxx thì sao ta
Benchmaxx là rõ. Vừa test deepseek v4 mới trên opencode, ngu hơn Luna medium nhiều. Với lại vẫn thiếu ổn định. Kiểu thỉnh thoảng ngu bất thường. Cho nó vào việc lại nát mẹ hết dự án.
Nhưng vẫn có ích nếu dùng cho mấy tác vụ kiểu ngu ngu chân tay vô thưởng vô phạt mà trước dùng Gemma 4. Ví dụ như tôi thử nghiệm cho nó vào game nhập vai học ngoại ngữ (mà skill, MCP và vocab bank đã được build đầy đủ bằng GPT 5.6 Terra) thì nó vẫn chạy được.
Deepseek nó chọn hướng giá rẻ nên mô hình của nó rất mỏng. Mấy tác vụ đua benchmark thì nó lúc làm tốt lúc không, nhưng chỉ cần lệch ngoài mấy cái đó là yếu xìu. Độ hoàn thiện kém rất xa GLM và Kimi. Kiểu hàng dạt chuyên làm task rác giống con Mimo V2.5.
 
Benchmaxx là rõ. Vừa test deepseek v4 mới trên opencode, ngu hơn Luna medium nhiều. Với lại vẫn thiếu ổn định. Kiểu thỉnh thoảng ngu bất thường. Cho nó vào việc lại nát mẹ hết dự án.
Nhưng vẫn có ích nếu dùng cho mấy tác vụ kiểu ngu ngu chân tay vô thưởng vô phạt mà trước dùng Gemma 4. Ví dụ như tôi thử nghiệm cho nó vào game nhập vai học ngoại ngữ (mà skill, MCP và vocab bank đã được build đầy đủ bằng GPT 5.6 Terra) thì nó vẫn chạy được.
Deepseek nó chọn hướng giá rẻ nên mô hình của nó rất mỏng. Mấy tác vụ đua benchmark thì nó lúc làm tốt lúc không, nhưng chỉ cần lệch ngoài mấy cái đó là yếu xìu. Độ hoàn thiện kém rất xa GLM và Kimi. Kiểu hàng dạt chuyên làm task rác giống con Mimo V2.5.
Vứt con Flash làm task của con Pro thì lại chẳng kêu benchmaxxed

Các model cấp thấp sinh ra để đám Pro cõng bọn nó đi.
 
Vứt con Flash làm task của con Pro thì lại chẳng kêu benchmaxxed

Các model cấp thấp sinh ra để đám Pro cõng bọn nó đi.
Ôi bạn ơi con v4 Flash mà lôi ra làm task thì nát hết code. Bạn đã bao giờ đọc review lại chỗ code nó viết chưa. Lủng bung bét. Trong khi so với con hàng giá rẻ khác là Luna thì nó khác hẳn mặc dù con Flash benchmark trông khủng khiếp hơn con Luna rất nhiều. Thế chẳng phải benchmaxx thì là cái éo gì nữa.
 
Ôi bạn ơi con v4 Flash mà lôi ra làm task thì nát hết code. Bạn đã bao giờ đọc review lại chỗ code nó viết chưa. Lủng bung bét. Trong khi so với con hàng giá rẻ khác là Luna thì nó khác hẳn mặc dù con Flash benchmark trông khủng khiếp hơn con Luna rất nhiều. Thế chẳng phải benchmaxx thì là cái éo gì nữa.

Tôi viết design với test sẵn rồi cho V4 Flash nó viết code tận tình theo cái doc đấy để tận dụng giá rẻ chứ tôi có bao giờ để nó nghĩ thay tôi đâu mà phải lo lủng
 
Tôi viết design với test sẵn rồi cho V4 Flash nó viết code tận tình theo cái doc đấy để tận dụng giá rẻ chứ tôi có bao giờ để nó nghĩ thay tôi đâu mà phải lo lủng
Thế có phải ngớ ngẩn không khi cho một con quá dốt làm task khiến bước review và test phải dùng nhiều token của model khôn để vá víu cho nó trong khi cuối cùng thì chất lượng code vẫn rất kém, thiếu tối ưu vì nó vẫn là code do con model ngu viết ra.
Bảo cho Opus/Sol làm plan rồi GLM/Kimi/Qwen Max/Terra/Luna/Deepseek Pro làm task nó còn có lý. Deepseek Flash làm thì đầu ra nó có ra cái gì đâu. Chẳng rác rưởi benchmaxx. Benchmaxx đến mức đè cả GLM 5.2, suýt bằng Terra và Opus thì nó lại chả láo toét vkl.
 
Hy3 thì sao các fence
Tôi test với một số task đơn giản thì ngang Deepseek Flash nhưng con Hy3 này agentic có vẻ kém, gọi tool sai hoặc không gọi được. Con Ling cũng khá lởm. Nói chung thì hàng Tàu giờ top vẫn là GLM/Kimi/Qwen. Dưới nữa thì Mimo/Deepseek/Seed. Còn Hy3/Ling/Step là đáy xã hội. Nhưng mà tôi khá thích con Step 3.7 vì có 1 task viết lách nó nhả ra kết quả hợp gu tôi.
 
Thế có phải ngớ ngẩn không khi cho một con quá dốt làm task khiến bước review và test phải dùng nhiều token của model khôn để vá víu cho nó trong khi cuối cùng thì chất lượng code vẫn rất kém, thiếu tối ưu vì nó vẫn là code do con model ngu viết ra.
Bảo cho Opus/Sol làm plan rồi GLM/Kimi/Qwen Max/Terra/Luna/Deepseek Pro làm task nó còn có lý. Deepseek Flash làm thì đầu ra nó có ra cái gì đâu. Chẳng rác rưởi benchmaxx. Benchmaxx đến mức đè cả GLM 5.2, suýt bằng Terra và Opus thì nó lại chả láo toét vkl.

Tôi có kêu dùng đám model khôn để review và test sau khi Flash nó viết code xong đâu :)))
Tôi kêu là viết sẵn design và test rồi cho V4 Flash làm theo mà :)))

Mà tôi cũng không bao giờ cho model đi review code thay tôi cả :)))
 

Thống kê chủ đề

Ngày tạo
dogamer06,
Người trả lời cuối
beovila1,
Trả lời
88
Lượt xem
14.514
Quay lại
Lên đầu trang