[Dịch] AI Trung Quốc bị tố “chuyển hướng” hội thoại sang Claude để luyện mô hình: Dữ liệu nhạy cảm, thậm chí bí mật quốc phòng, có nguy cơ bị lộ

Deepseek V4 Flash thì kèo thơm quá chứ K3 kia nó đòi ~600GB RAM lận.

Đợt có test con 3050 4GB cỏ với 3060 với model ~26B A3B của Google thì tối thiểu để chạy tốc độ chấp nhận được ~2GB VRAM thôi, còn lại nhét vào RAM chạy. Cũng 26B mà dense thì ko chơi nổi.
Deepseek V4 flash thì kể của quant 1bit thì cũng cần min 60GB vram để chạy, chưa kể activation, runtime, buffer..

Còn context hay codebase thì nó ở KV cache có nằm chung model weight đ' đâu. :feel_good:

Mấy thằng kia chỉ cần thấy Tàu là lao vào def bất chấp rồi chửi đổng, công kích cá nhân chứ có biết cái moẹ gì đâu, tuởng thế nào. :baffle:
 
Deepseek V4 flash thì kể của quant 1bit thì cũng cần min 60GB vram để chạy.

Còn context hay codebase thì nó ở KV cache có nằm chung model weight đ' đâu. :feel_good:
60GB kia là để max speed chứ ko phải là min chạy được fen.
Đang tải DS V4 Flash về test thử, có gì xin nhẹ 100k uống cafe:smile:

Mình ko def tàu gì cả nên mọi người đừng thả gạch nhá.
 
60GB kia là để max speed chứ ko phải là min chạy được fen.
Đang tải DS V4 Flash về test thử, có gì xin nhẹ 100k uống cafe:smile:

Mình ko def tàu gì cả nên mọi người đừng thả gạch nhá.

1 bit quant thì minium requirement cũng cần 60GB VRAM rồi vì 284B params. K offload system ram thì k bao h fit đuợc.

Mà 1 bit quant thì còn gì gọi là model nữa là thứ què quặt khuyết tật rồi
uxby0Nl.gif
 
Con 5090 làm sao chạy con kimi k3 dc, kể cả q1 , mấy bố toàn kèo ma quỷ gì vậy, tới hạn là đám qwen 3.8 là hết r, tôi chạy local AI ở nhà đây
 
Con 5090 làm sao chạy con kimi k4 dc, kể cả q1 , mấy bố toàn kèo ma quỷ gì vậy, tới hạn là đám qwen 3.8 là hết r, tôi chạy local AI ở nhà đây
Bố kia nổ lớn quá chứ kèo Deepseek V4 Flash thấy khá ok.
Con V4 Flash kia nó có 13B activated thì tống 13B đấy vào VRAM là khoẻ.

Qwen 3.8 nó 27B dense phải tống hết 27B mới chạy được chứ ko nó què quặt ko xài được.
 
A ấy đòi fit tất vào con 5090 mà. Có đề cập gì tới dense hay attention layer đâu :shame:

Thế thì đưa đúng con 5090 32GB cho fit vào hết thôi, ngưòi ta khẳng định chắc nịch còn chê ng khác dev quèn mà :feel_good:
 
Bố kia nổ lớn quá chứ kèo Deepseek V4 Flash thấy khá ok.
Con V4 Flash kia nó có 13B activated thì tống 13B đấy vào VRAM là khoẻ.

Qwen 3.8 nó 27B dense phải tống hết 27B mới chạy được chứ ko nó què quặt ko xài được.
đang kiếm cái DS v4 flash mà kok thấy cái nào note là có 13B activated cả
 

Tệp đính kèm

  • Screenshot 2026-09-13 004635.webp
    Screenshot 2026-09-13 004635.webp
    71 KB · Lượt xem: 1
có v4.1 flash, ~100GB, cái này là load hết lên mem thôi chứ có phải MoE đâu, nếu GPU hết mem thì RAM nó gánh cho, nhưng mà lúc này speed giảm thê thảm lun
 

Tệp đính kèm

  • Screenshot 2026-09-13 005114.webp
    Screenshot 2026-09-13 005114.webp
    64 KB · Lượt xem: 1
có v4.1 flash, ~100GB, cái này là load hết lên mem thôi chứ có phải MoE đâu, nếu GPU hết mem thì RAM nó gánh cho, nhưng mà lúc này speed giảm thê thảm lun
4.1 flash là model hoàn toàn khác, size khác luôn.
Speed nó giảm nhưng ko đến nỗi đơ luôn máy như mấy con dense. Ko rõ con V4 flash như nào chứ test con Qwen MoE 26B gì đấy ra được ~5-10t/s.
1789235634114.webp


Nguồn: deepseek-ai/DeepSeek-V4.1-Flash · Hugging Face (https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash)
 
4.1 flash là model hoàn toàn khác, size khác luôn.
Speed nó giảm nhưng ko đến nỗi đơ luôn máy như mấy con dense. Ko rõ con V4 flash như nào chứ test con Qwen MoE 26B gì đấy ra được ~5-10t/s.
Xem tệp đính kèm 3794214

Nguồn: deepseek-ai/DeepSeek-V4.1-Flash · Hugging Face (https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash)
nhưng nó k fit vào 32GB VRAM.
Nhét 13B active params kia vào thì vẫn cần offload backbone 284B params.
K offload sang system ram thì k có cái mùa xuân chạy đuợc với 1 con 5090. Kèo thơm thế mà lại sủi rồi. :sexy_girl:

Uổng công mấy page đầu def hăng hái, mở miệng ra là chửi đổng đuợc liền cổ lâu chủ nào tớ nấy :baffle: (k noi' fen)
 
Sửa lần cuối:
nhưng nó k fit vào 32GB VRAM.
Nhét 13B active params kia vào thì vẫn cần offload backbone 284B params.
K offload sang system ram thì k có cái mùa xuân chạy đuợc với 1 con 5090. Kèo thơm thế mà lại sủi rồi. :sexy_girl:

Uổng công mấy page đầu def hăng hái, mở miệng ra là chửi đổng đuợc liền cổ lâu chủ nào tớ nấy :baffle:
thì nó kok fit vào r,

đang thử cài cái deepseek v4.1 mà kok thấy bản unsensor cũng hơi chán, bản v4 thì có, lấy về cho 2 thằng qwen3.8 với deepseek chat sex với nhau
:sexy_girl:
 
nó ghi có MoE mà lấy về sao kok thấy nhỉ ?

trên llm studio cũng kok suggest model từ chính deepseek v4, mà toàn là model v4 flash dc cook lại, tương tự như cái v4.1 cũng toàn là cook lại, còn hàng chính chủ kok kiếm ra nên kok biết có vấn đề gì từ nó k
Cái model fen tải về đã cook là hàng cook Pro.
Còn thêm QAT là cook Pro Max, cơ mà chỉ có Google nó rảnh tài nguyên mới có con QAT đấy chứ Deepseek server chả có kiếm đâu ra QAT.

Hàng chính chủ bình thường nặng quá ai mà mang chạy local fen, tụi nó để hàng chính chủ đấy để ai thích bê về cook thì bê, còn ko thì thuê server ngoài chạy.
Thường mấy con parameter bự mấy trăm B cook nó thành Q1 nó vẫn ăn đứt mấy con bé ~30B Q4 Q8 gì đấy.
 
Cái model fen tải về đã cook là hàng cook Pro.
Còn thêm QAT là cook Pro Max.

Hàng chính chủ bình thường nặng quá ai mà mang chạy local fen, tụi nó để hàng chính chủ đấy để ai thích bê về cook thì bê, còn ko thì thuê server ngoài chạy.
Thường mấy con parameter bự mấy trăm B cook nó thành Q1 nó vẫn ăn đứt mấy con bé ~30B Q4 Q8 gì đấy.
con v4.1 mới ra dc mấy tiếng nên chưa có ai cook ra bản uncensor, mấy cái localAI chủ yếu là phải xài uncensor nó mới sướng rơn người chứ
:shame:
 

Thống kê chủ đề

Ngày tạo
khelo,
Người trả lời cuối
SpaceXAI,
Trả lời
184
Lượt xem
19.615
Quay lại
Lên đầu trang