thảo luận Deepseek AI vào hết đây

  • Người tạo chủ đề Người tạo chủ đề Zaunite
  • Ngày bắt đầu Ngày bắt đầu
Đéo hiểu sao vẫn còn cơ số những thằng ngu nghĩ rằng thằng deepseek này mua 1 tỉ đô tiền card của Nvidia nhỉ . To như cái mả bố thằng ăn mày là bytedance còn đéo mua được thì thằng deepseek mua kiểu gì . Mà mua xong còn phải set up còn tốn cả đống time . Mẹ tụi mày ngu thì ngu nó cũng vừa phải thôi chứ . Nó có card Nvidia thì cũng là hàng kém hơn chứ mua H100 được cái đầu phuồi ấy . Con mẹ nó cắm đầu cắm cổ post cái tin để cố mà lồng ghép cái mẩu tin "chi tỉ đô mua H100" . Đéo hiểu kiểu gì !!!
Cả cái quỹ có 8 tỏi U bảo chi 2 tỏi U (chưa tính chi phí khác) mua cạc train llm (đéo phải mục đích chính của công ty) :LOL::LOL:. Cổ đông công ty mà biết chắc cầm súng sang bắn vỡ sọ thằng giám đốc rồi
 
Anh là người khơi mào trước giờ lại đổ cho tôi . Lol .

Ok mùng 1 . Cheer .

via theNEXTvoz for iPhone
Giả sử La Sát quốc của Phú Tình cho ra mắt một con AI như Deepseek thì tự dưng mọc ra một số Chiên za "khách quan trung nập" trí tuệ vô song phủ nhận thành tựu của La Sát quốc.
Có những người bàn về thành tựu khoa học công nghệ mà cứ như đang bàn Chính trị phò abc chửi xyz, phò xyz chửi abc với chửi kẻ thù Giết cha... Mạt
 
Sửa lần cuối:

nguồn gốc của tin này là bài fake new bẩn bựa của truyền thông phương tây này (CNBC)
Tile ghì ghi là Ceo của Deep bảo là xác nhận có 50.000 con H100
Trong bài thì phỏng vấn thằng CEO Scale AI (mà thằng này đoán mõm chứ không đưa ra bằng chứng nào)
Chinese AI lab DeepSeek has access to tens of thousands of NVIDIA H100 AI GPUs for training, according to DeepSeek CEO.
Sắp dùng bài "an ninh quốc gia " rồi
 
Kiện vì lý do gì và có phải do đấu không lại kiện không? tôi hỏi thật, xin dẫn chứng.
 
Vụ email này tôi là thằng post mail leak ra từ đầu trong thớt bầu cử chứ đâu, Mút nó kiện tôi biết nhưng anh kia bảo kiện vì đấu không lại OpenAI, cái tôi cần là dẫn chứng vụ đó chứ còn ở Mỹ kiện mấy cái này quá bình thường.
 
Anh là người khơi mào trước giờ lại đổ cho tôi . Lol .

Ok mùng 1 . Cheer .

via theNEXTvoz for iPhone

1. Kiến trúc MoE của DeepSeek-V3
• Quy mô 685 tỷ tham số: Trong đó, 671 tỷ là tham số của “mô hình chính” (dựa trên MoE) và 14 tỷ còn lại thuộc về module Multi-Token Prediction (MTP).
• Chia thành nhiều “experts”: DeepSeek-V3 triển khai khoảng 64 experts, mỗi expert có tầm 10,5 tỷ tham số.
• Sparse activation: Thay vì kích hoạt tất cả tham số (giống các mô hình dense), mỗi token chỉ kích hoạt 2–4 experts, giúp giảm mạnh FLOPs (số phép tính) cũng như bộ nhớ.

Lợi ích MoE
• Tiết kiệm tài nguyên: Kích hoạt có chọn lọc tham số nên mô hình “nhẹ” hơn về tính toán.
• Hiệu suất cao: Mỗi expert chuyên “giỏi” một loại ngữ cảnh/dữ liệu, nên vẫn đảm bảo chất lượng đầu ra.

2. Tính toán chi phí thực tế

Khi chia 671 tỷ tham số thành 64 experts và mỗi token chỉ gọi 2 experts, số FLOPs thực tế chỉ còn ~18,75% so với mô hình dense cùng quy mô.
• Tổng FLOPs ước tính: ~2,28×10^23 FLOPs (với khoảng 300 tỷ token huấn luyện).
• Phần cứng & thời gian: DeepSeek dùng 3.000 GPU H800 (hiệu suất ~300 TFLOPS/GPU). Về mặt lý thuyết, thời gian huấn luyện có thể ~70 giờ nếu chạy full công suất. Nhưng tính cả overhead do phân tán, thực tế mất khoảng 2 tháng.
• Chi phí: Ước tính ~4,32 triệu USD cho tiền GPU (với giá 1 USD/GPU-giờ). Chênh lệch so với 6 triệu USD còn lại được dùng cho dữ liệu, module MTP và lương kỹ sư.

3. DeepSeek tối ưu MoE như thế nào?
• Cân bằng tải giữa các experts:
• Dùng router loss để mỗi expert đều được “kêu gọi” hợp lý, tránh tình trạng “expert bị bỏ quên”.
• Tối ưu hóa routing để xử lý băng thông thấp của H800.
• Kết hợp cùng MTP:
• MTP (14 tỷ tham số) dự đoán nhiều token cùng lúc, cắt giảm số lần inference và tăng tốc huấn luyện.
• 3D Parallelism:
• Tensor Parallelism: Chia nhỏ từng expert trên nhiều GPU.
• Pipeline Parallelism: Xâu chuỗi các lớp để xử lý tuần tự.
• Data Parallelism: Chia batch dữ liệu cho nhiều GPU chạy song song.

4. So sánh nhanh với vài mô hình MoE khác
• DeepSeek-V3: 685 tỷ tham số (64 experts), chi phí ~6 triệu USD, chạy trên 3.000 GPU H800.
• Google Switch Transformer: 1.572 tỷ tham số (64 experts), chi phí ~10 triệu USD, chạy trên 4.096 TPU v4.
• Mistral 8x22B: 141 tỷ tham số (8 experts), chi phí ~2 triệu USD, chạy trên 1.000 GPU H100.

Điểm đáng chú ý: DeepSeek-V3 đạt hiệu quả tốt nhờ chỉ kích hoạt 2/64 experts cho mỗi token, đồng thời vẫn tận dụng được H800 giá “mềm” hơn.

5. Vì sao DeepSeek-V3 vẫn “ăn khách” dù dùng MoE?
• Chi phí triển khai rẻ: Batch inference lớn, kích hoạt ít experts/token nên tiết kiệm tài nguyên.
• Chất lượng chuyên sâu: Mỗi expert đều được huấn luyện cho một loại ngữ cảnh riêng (giao tiếp tự nhiên, v.v.), rất phù hợp ứng dụng di động.
• Tốc độ tốt: Độ trễ của mô hình 685B khoảng 100ms/token trên server; kết hợp caching giúp cải thiện trải nghiệm người dùng. Thậm chí, họ còn dùng quantization 4-bit cho experts để có thể chạy trên iPhone.

6. Thách thức khi triển khai MoE
• Huấn luyện phức tạp: Cần cân bằng tài nguyên, tránh nghẽn băng thông khi truyền dữ liệu (H800 có NVLink ~400 GB/s).
• Đòi hỏi bộ nhớ lớn: Model 685B ngốn hơn 5TB VRAM, nên phải chia nhỏ (sharding) và offload sang bộ nhớ ngoài.
• Rủi ro chính trị: Phụ thuộc vào GPU NVIDIA, trong khi vẫn đang có nguy cơ bị giới hạn hoặc cấm vận.

7. Kết luận

Việc áp dụng MoE đã giúp DeepSeek huấn luyện mô hình 685 tỷ tham số chỉ với ~6 triệu USD trong 2 tháng, tiết kiệm khoảng 80% FLOPs so với mô hình dense tương đương. Thành công này dựa vào:
1. Chiến lược parallel hóa thông minh để khai thác tối đa H800.
2. Dữ liệu được chọn lọc và phân mảnh hợp lý theo từng expert.
3. Hạ tầng hỗ trợ (điện, network) và có thể cả chính sách nội địa. Nhưng giá điện Trung Quốc vốn dĩ đã trong top rẻ nhất thế giới.

via theNEXTvoz for iPhone
 
Vụ email này tôi là thằng post mail leak ra từ đầu trong thớt bầu cử chứ đâu, Mút nó kiện tôi biết nhưng anh kia bảo kiện vì đấu không lại OpenAI, cái tôi cần là dẫn chứng vụ đó chứ còn ở Mỹ kiện mấy cái này quá bình thường.
Check lại thì lão này có kiện mà, còn ai đúng ai sai thì không bàn.
 
Là người dùng thì quan tâm cái nó train bằng gì, giá nhiêu để làm gì nhỉ? Cái này chỉ là vấn đề mấy thằng cung cấp dịch vụ lo để tối ưu chi phí sản xuất.
Trong khi cái ưu điểm của nó hiện tại là dùng ít tài nguyên hơn, giá thành rẻ hơn thì chả ai thấy bàn. Từ mấy hôm trước tới giờ, hết thì lôi mấy câu chính trị ra hỏi xong giờ lôi cái nghi ngờ bằng feeling. Hỏi xem có nguồn nào chứng minh không thì lại tịt.
Cái ngon nhất của con này là chạy được trên card phổ thông, máy cá nhân mà vẫn đủ thông minh
Đa số các cty và người dùng thường xuyên cho công việc lại ko cần 1 cái siêu AI đa nghề đa lĩnh vực, họ cần chuyên gia về 1 mảng/1 ngách/ 1 số tác vụ cho nhu cầu của riêng họ
Tự train, local sẽ bảo mật được dữ liệu nhạy cảm; ko bị vướng những tiêu chuẩn cộng đồng, rào cản "đạo đức", thiên lệch chủng tộc/văn hóa/giới tính/chính trị...; ko phụ thuộc vào biến động chính sách của bigtech
Đám bigtech trộm cắp data lẫn ý tưởng người dùng thế nào, những con AI tỉ đô bị méo mó và ngu hoá bởi thiên lệch chính trị lẫn woke ra sao chắc ai cũng từng trải nghiệm
 
Sửa lần cuối:
Check lại thì lão này có kiện mà, còn ai đúng ai sai thì không bàn.
Ai chả biết nó kiện, lí do kiện là gì có thỏa mãn cái "vì đấu không lại nên kiện" không, còn không có thì anh trích dẫn ra làm gì mất tg. Bản thân nó mới build supercomputer tháng 9 đây thì có lại hay không thời gian sẽ trả lời.
 
Cái ngon nhất của con này là chạy được trên card phổ thông, máy cá nhân mà vẫn đủ thông minh
Đa số các cty và người dùng thường xuyên cho công việc lại ko cần 1 cái siêu AI đa nghề đa lĩnh vực, họ cần chuyên gia về 1 ngách/ 1 số tác vụ cho nhu cầu của riêng họ
Tự train, local sẽ bảo mật được dữ liệu nhạy cảm; ko bị vướng những tiêu chuẩn cộng đồng, rào cản "đạo đức", thiên lệch chủng tộc/văn hóa/giới tính/chính trị...; ko phụ thuộc vào biến động chính sách của bigtech
Đám bigtech trộm cắp data lẫn ý tưởng người dùng thế nào, những con AI tỉ đô bị méo mó và ngu hoá bởi thiên lệch chính trị lẫn woke ra sao chắc ai cũng từng trải nghiệm
Cái này lợi vì nó vừa có tính phổ biến, vừa có tính tùy biến luôn.
Hóng sắp tới mỗi nhà 1 con AI, train theo đúng ý người dùng luôn.
 

Thống kê chủ đề

Ngày tạo
Zaunite,
Người trả lời cuối
Jaeho Kouki,
Trả lời
2.993
Lượt xem
519.749
Quay lại
Lên đầu trang