ooopsvn
Senior Member
DeepSeek đã phát hành phiên bản hoàn chỉnh của sản phẩm chủ lực vào thứ Tư mà không có bài đăng trên blog hay thông báo nào. Dấu hiệu nhận biết nằm ở một ô trong bảng: phiên bản model được liệt kê cho "deepseek-v4-pro" trên trang giá API giờ đây là DeepSeek-V4-Pro-0813.
Chi phí sử dụng mô hình này vào khoảng 0,435 đô la và 0,87 đô la cho mỗi triệu token (đơn vị thông tin cơ bản mà mô hình có thể xử lý) đầu vào và đầu ra. Vì vậy, cấu trúc giá vẫn giữ nguyên, nhưng điều thay đổi là các trọng số bên dưới.
Deepseek V4 Pro đã được bán ra thị trường từ tháng 4, với giá thấp hơn 98% so với GPT-5 Pro, và tất cả các phòng thí nghiệm độc lập đã thử nghiệm đều đang thử nghiệm phiên bản xem trước. Chính DeepSeek đã xác nhận điều này vào ngày 31 tháng 7, khi họ phát hành V4-Flash ra thị trường và lưu ý rằng API phiên bản Pro "không thay đổi" và phiên bản chính thức sẽ "sớm được phát hành". Thẻ mô hình trên Hugging Face, kho lưu trữ hàng đầu cho các dự án AI mã nguồn mở, vẫn mô tả dòng V4 là "phiên bản xem trước".
Vì vậy, các điểm số được lan truyền rộng rãi mô tả một bản dựng DeepSeek v4 chưa hoàn thiện. Cho đến nay, chưa ai bên ngoài công ty tiến hành kiểm tra hiệu năng độc lập đối với phiên bản 0813.
Bảng dữ liệu của DeepSeek khẳng định điều gì?
Công ty đã công bố một bảng so sánh trên 10 tiêu chuẩn đánh giá tác nhân. Trên tám tiêu chí mà Fable 5 hoặc một mô hình khác có ưu thế, sự khác biệt là không đáng kể.
Như vậy, các điểm số được lan truyền rộng rãi mô tả một bản dựng mà DeepSeek cho là chưa hoàn thiện. Hiện tại, chưa có bên nào tiến hành kiểm tra hiệu năng độc lập đối với phiên bản 0813.
![]()
Tính trung bình, Fable 5 dẫn trước tương đối so với các bài kiểm tra vào khoảng 5,3%. Loại bỏ bài kiểm tra Humanity's Last Exam không dùng công cụ hỗ trợ—trong đó DeepSeek đạt 42,7 điểm so với 53,3 điểm của Fable 5, tạo ra khoảng cách 10,6% làm sai lệch kết quả—thì các hàng còn lại có mức trung bình là 2,8%.
Giá cả được công khai ở cả hai phía, và đây là điểm khiến sự so sánh không còn sát sao nữa. Fable 5 có giá 10 đô la cho mỗi triệu token đầu vào và 50 đô la cho mỗi triệu token đầu ra. V4 Pro có giá 0,435 đô la và 0,87 đô la, với dữ liệu đầu vào được lưu vào bộ nhớ đệm ở mức 0,003625 đô la. Tính theo tỷ giá hỗn hợp, con số này là 30 đô la so với 0,65 đô la—khoảng 46 lần, hay 4.600% chi phí. Đó là mức chênh lệch đáng kể khi bạn đang điều hành một doanh nghiệp và sử dụng các công cụ AI ở quy mô lớn.
Chi phí cho mỗi tác vụ hoàn thành có sự chênh lệch lớn hơn, vì Fable 5 xử lý lâu hơn và ghi nhiều dữ liệu hơn. Artificial Analysis đã đo được mức chi phí là 3,15 đô la cho mỗi tác vụ chuẩn so với 3 cent của V4-Flash, rẻ hơn khoảng 105 lần. Giám đốc điều hành của Hugging Face, Clément Delangue, ước tính mức chênh lệch là hơn 31 đô la cho mỗi tác vụ so với khoảng 0,04 đô la. Hiện chưa có số liệu về chi phí cho mỗi tác vụ đối với phiên bản 0813.
Chính dòng sản phẩm của Anthropic lại làm phức tạp thêm vấn đề giá cả. Claude Opus 5 cũng đạt điểm cao hơn Fable 5 trên hầu hết các bài kiểm tra hiệu năng với giá chỉ bằng một nửa.
DeepSeek tự chấm điểm các bài kiểm tra này trên cơ sở hạ tầng mà họ chưa công bố. Ghi chú hồi tháng 7 của họ nêu rõ chế độ tối thiểu của DeepSeek Harness "sẽ sớm được phát hành", chạy ở mức nỗ lực tối đa với độ sáng tạo cao. Hai trong số mười bài kiểm tra hiệu năng, DSBench-FullStack và DSBench-Hard, là các bộ kiểm tra nội bộ không có bảng xếp hạng công khai để so sánh.
Tuy nhiên, xu hướng này vẫn nhất quán. Các phòng thí nghiệm mã hóa dữ liệu mở của Trung Quốc liên tục đạt được những tiến bộ vượt bậc so với các phòng thí nghiệm của Mỹ với chi phí thấp hơn nhiều—Kimi K3 đã đánh bại Fable 5 và GPT-5.6 Sol ngay khi ra mắt, và DeepSeek cùng Xiaomi đã giảm chi phí đến 99% trong khi các phòng thí nghiệm của Mỹ lại đi theo hướng ngược lại. Bộ dữ liệu của DeepSeek được cấp phép theo giấy phép MIT và có trên Hugging Face, vì vậy việc xác minh độc lập chỉ cần tải xuống một lần.
China’s DeepSeek Upgrades V4 Pro: Claude Fable Is Only 5% Better at 4,500% the Price
The April preview got benchmarked to death and landed 18 points behind Anthropic’s flagship. DeepSeek’s own numbers for the finished model tell a very different story.




)

