thảo luận Deepseek AI vào hết đây

  • Người tạo chủ đề Người tạo chủ đề Zaunite
  • Ngày bắt đầu Ngày bắt đầu
Ròi cũng như ASIC hồi xưa thôi, xưa dùng GPU cày đắt vãi cứt và tốn điện. Tàu nó ra mấy quả ASIC cái là farm coin bùng nổ luôn.
Định hướng của Tàu với AI này cũng thế, bọn nó đang nghiên cứu "ASIC" chuyên dụng train AI. Nó mà ra dc mấy quả giá rẻ thì AI phổ cập cmnl
BdgiW7R.png
Phép màu sảy ra thật thì nvidia đi bụi.

via theNEXTvoz for iPhone
 
Thằng này học MIT xong 1 năm sau bỏ học vì chê MIT ko đủ tầm dạy nó và đi khởi nghiệp lun. Bọn Tàu trí óc đỉnh vl.
VN cũng có vài chục đứa du học bên MIT, Standford, Yale, mà toàn đám ngu đần dốt nát, chả đứa nào làm dc trò trống khỉ gì.
Người việt thông minh mà. :cautious: Đầu óc dân ta không đỉnh thì ai đỉnh vào đây:love:
Screenshot 2025-01-27 172100.png


Screenshot 2025-01-27 172220.png
 
Ko hẳn phá mà đưa ai về đúng giá trị, tụi tây thổi lên xong bán phần cứng cắt cổ, giờ có giá rẻ xài ngon vl ngu gi ko xài
bệnh của bọn Mẽo rồi, tưởng cấm bán mấy con chip AI xịn như A100 - H100 cho bọn Tàu là xong mà đ biết mảng AI này thuật toán quan trọng ntn, chỉ cần optimize tốt thì không thua kém quá xa lũ dùng chip xịn train mô hình
GopPuvT.png

có bọn này đâm bị thóc chọc bị gạo cũng tốt, để cho lũ Claude - Gemini với OpenAi tăng cường tối ưu thuật toán bớt ngáo đấm tiền sắm chip AI xịn bắt người dùng trả tiền đi hehe
rODmiTb.gif
 
Sửa lần cuối:
:beat_brick: :beat_brick: :beat_brick:đọc trên facebook toàn mấy thằng dìm con AI này trong khi nó có nhiều ý nghĩa và có lợi cho người dùng
 
Nếu đúng như thím nói thì mấy thằng tàu này cũng phá game phết nhỉ 🤣
thôi xong:
DeepSeek đã đạt được những bước tiến đáng kể trong việc phát triển các mô hình AI hiệu quả về chi phí. Cụ thể, mô hình DeepSeek-V3 có chi phí xử lý khoảng 0,27 USD cho mỗi triệu token đầu vào và 1,10 USD cho mỗi triệu token đầu ra, thấp hơn đáng kể so với GPT-4, với chi phí tương ứng là 2,50 USD và 10,00 USD. Điều này cho thấy DeepSeek-V3 tiết kiệm hơn khoảng 90% so với GPT-4 trong việc xử lý đầu vào và đầu ra. (BigGo)

Ngoài ra, quá trình huấn luyện mô hình DeepSeek-V3 chỉ tiêu tốn khoảng 5,5 triệu USD, thấp hơn đáng kể so với chi phí huấn luyện của GPT-4, ước tính lên đến hàng trăm triệu USD. (Blog Cốc Cốc)

Những con số này cho thấy DeepSeek đã tối ưu hóa hiệu suất và chi phí một cách hiệu quả, đặt ra thách thức lớn cho các mô hình AI hiện có như ChatGPT.
 
Các ông đọc bài phân tích này thì mới thấy bọn tàu khựa bá đấy. Tư duy rất châu á luôn, ko phải bốc phét đâu. 1 con nó publish paper dài khủng khiếp cho thích thì tự implement, 1 con thì nó opensource hết tham số. Ngay lập tức cả làng AI thế giới nhảy vào phân tích chọc ngoáy và thấy đúng là bọn tàu nó ko phét tí nào.
🔥
🔥
🔥
Lại cháy nữa lên ae, lại có thêm 1 mô hình Kimi k1.5. Một mô hình đa phương thức cấp độ o1
-Hiệu suất Short-CoT (Chuỗi suy luận ngắn) vượt trội, vượt xa GPT-4o và Claude Sonnet 3.5 trong các bài kiểm tra
📷
AIME,
📷
LiveCodeBench với tỷ lệ chênh lệch lớn (lên đến +550%)
-Hiệu suất Long-CoT (Chuỗi suy luận dài) tương đương với o1 trên nhiều phương thức (
📷
MathVista,
📷
Codeforces, v.v.)
Báo cáo kỹ thuật: i-k1.5...
Các thành phần chính của k1.5:
-Khả năng mở rộng ngữ cảnh dài. Hỗ trợ đến 128k tokens cho việc sinh RL (Reinforcement Learning). Huấn luyện hiệu quả với partial rollouts.
-Tối ưu hóa chính sách nâng cao: online mirror descent, chiến lược lấy mẫu, hệ số phạt độ dài, và các yếu tố khác.
-Đa phương thức. Suy luận kết hợp giữa văn bản và hình ảnh.
Nghiên cứu kỹ 2 paper về hai model cực khủng (DeepSeek R1 và Kimi 1.5) ngang tầm “o1-style” của các pháp sư Trung Hoa, tóm gọn lại thì như thế này:
1. Ý tưởng chung: Không còn “cồng kềnh” như trước
a) Bỏ Tree Search (MCTS), chỉ cần “nghĩ thẳng một dòng” (linearize)
• Trước giờ: Ta thường thấy AI “chiến” cờ vua, cờ vây dùng MCTS (Monte Carlo Tree Search) để tìm nước cờ ngon. Rất mạnh, nhưng code và tính toán khá phức tạp.
• Giờ: DeepSeek và Kimi đều bảo, “Trên thực tế, ta chỉ cần cho mô hình suy nghĩ theo mạch (chính là Chain of Thought) và dự đoán lần lượt (autoregressive) là đủ.”
• Ví dụ hình dung:
• Giả sử có một cậu bé học cờ vua, thay vì cậu ấy phải vẽ ra cả cái cây quyết định khổng lồ hàng chục nhánh (MCTS), cậu ấy chỉ cần suy luận tuần tự: “Đi tốt lên, đối thủ sẽ làm gì?, Mình phản ứng thế nào?”… cứ thế nối tiếp một đường suy nghĩ ngắn-gọn-mà-trúng.
b) Không cần thêm mạng giá trị (Value Network) cồng kềnh
• Ngày xưa: Trong RL kiểu cũ, ta thường có hai mạng to tướng: một mạng để “ra quyết định” (policy network) và một mạng để “định giá, đo lợi hại” (value network).
• Giờ: Hai nhóm này bảo, không cần phải tách riêng cái value network kia. Vì huấn luyện song song hai “con quái vật” to đùng rất tốn sức (tiền điện, GPU, thời gian…).
• Thực tế: Họ dùng luôn chính mô hình chính (policy) hoặc vài thủ thuật đánh giá đơn giản để thay thế. Thế là tiết kiệm rất nhiều.
c) Tập trung vào kết quả cuối (End Result) hơn là chấm điểm tí tí (Dense Reward)
• Thường thấy: Mọi người thích “chấm điểm” mô hình ở mỗi bước (dense reward) hay dùng “mô hình reward” riêng để phân biệt câu trả lời nào tốt hơn.
• Hai nhóm: Gợi ý “Cứ nhìn chung cuộc xem đúng sai, được hay không” – kiểu như AlphaZero chỉ quan tâm “thắng” hay “thua” cuối. Hạn chế bớt can thiệp chi li, mô hình sẽ học “lối tư duy” một cách tự nhiên hơn (và bớt phức tạp).
• Ví dụ: Học đá bóng, thay vì huấn luyện AI mà cứ 5 giây cho thêm/giảm 1 điểm, ở đây họ bảo “chỉ cần nhìn tỉ số chung cuộc” (thắng thua) là cũng đủ để AI tự rút kinh nghiệm.
2. Sự khác nhau giữa DeepSeek R1 và Kimi 1.5
a) Khởi động (Bootstrapping) khác biệt
1. DeepSeek R1:
• “Cold start” kiểu AlphaZero: Tự mày mò từ đầu, không (hoặc rất ít) dữ liệu được “dạy trước” bởi con người.
• Thoạt nghe hơi cực đoan, nhưng nếu chạy lâu, chịu khó “cày” thì có thể đạt level rất cao (như AlphaZero đánh bại AlphaGo).
2. Kimi 1.5:
• Dùng “mồi” trước (SFT – Supervised Fine-tuning) kiểu AlphaGo Master: Lấy một ít dữ liệu đã gắn nhãn (ví dụ những “hướng suy luận CoT” do con người soạn) để huấn luyện nhanh buổi đầu, rồi mới chuyển sang RL.
• Kết quả cho thấy mô hình này “lên tay” nhanh hơn, nhất là trong mấy bài toán phức tạp.
b) Cấp độ mở (Open Source) & Giấy phép
• DeepSeek: Công bố toàn bộ trọng số (weights) theo giấy phép MIT – cực kỳ thoáng, ai cũng xài được. Đây là nước đi “chơi lớn” để cộng đồng tha hồ tùy biến.
• Kimi: Hiện chưa phát hành mô hình chính thức. Chỉ công bố paper với nhiều chi tiết kỹ thuật. Ai muốn chạy thử “chính chủ” thì chắc phải… chờ.
c) Tính năng đa phương thức (Multimodal)
• Kimi 1.5 được báo cáo là xử lý tốt nhiều kiểu dữ liệu (văn bản, hình ảnh, biểu đồ, câu đố IQ, hình học…) – họ đưa ra thí nghiệm với MathVista, nơi phải nhìn và hiểu hình rồi giải bài toán.
• DeepSeek chưa đề cập nhiều phần này, hoặc chưa công bố kết quả. Có thể họ đang tập trung vào khía cạnh khác.
d) Chi tiết triển khai: Kimi “kể” nhiều, DeepSeek “kể” ít
• Kimi:
• Paper khá dày, mô tả từ hạ tầng RL (làm cluster, song song ra sao),
• Tới code sandbox (cho mô hình tự viết code, chạy thử, check kết quả),
• Chiến lược nén CoT (vì context quá dài),
• Cách tạo “bài tập” cho mô hình dần khó hơn (curriculum),
• V.v.
• DeepSeek: Không chia sẻ quá sâu về cách họ xây hệ thống, nhưng bù lại mở luôn trọng số để community vọc.
3. Đọc xong, ta rút ra gì?
1. RL trên mô hình ngôn ngữ không phải lúc nào cũng cần những cơ chế phức tạp như MCTS, value network hay reward model riêng.
2. Cách tiếp cận “tối giản” (simple pipeline) + “dựa vào kết quả cuối” đang được cả DeepSeek và Kimi chứng minh là rất hiệu quả.
3. So sánh hai hướng:
• DeepSeek = “tôi tự chơi, tôi tự học, không cần ai nâng đỡ” (AlphaZero style),
• Kimi = “cho tôi tí ví dụ ban đầu để khởi động” (AlphaGo Master style).
4. DeepSeek “open” (MIT license), Kimi “kín” hơn về model, nhưng bù lại viết paper rất chi tiết.
5. Tương lai, chắc chắn cộng đồng sẽ khai thác hai mô hình (và các ý tưởng của họ) để nâng cấp những LLM hay mô hình đa phương thức khác.
Tóm gọn: Hai nghiên cứu này cho thấy: “Đôi khi cứ làm đơn giản, đừng làm phức tạp là tốt nhất”. Họ đưa minh chứng rõ ràng rằng cắt giảm những module rườm rà (tree search, value net, dense reward) lại cho kết quả tốt bất ngờ, miễn là ta huấn luyện đúng cách. Hơn nữa, việc chia sẻ (hoặc không) trọng số, và cách khởi động RL (có hay không có dữ liệu con người) sẽ quyết định mô hình nào phù hợp với mục tiêu, thời gian, và ngân sách tính toán của từng nhóm.
BÀI TIẾP
REVIEW nhanh Kimi 1.5 , mô hình ngang ngửa DeepSeek R1, cũng đến từ các pháp sư Trung Hoa
🔥
🔥
🔥

Ok như vậy là Kimi 1.5 đã chính thức mở cho người dùng sử dụng, chỉ cần đăng ký bằng số điện thoại là đc, khá nhanh. nếu bạn nghe đến cái tên này đầu tiên thì đây là 1 mô hình AI mạnh ngang ngửa DeepSeek R1 , công ty đứng đằng sau là MoonShot cũng rất mạnh, ra mắt gần như cùng 1 thời điểm nhưng nay họ mới mở cho mọi người dùng chính thức và miễn phí.
Mình vừa mới test nhanh khả năng giải toán tư duy , 1 bài mẫu từ bộ đề của Trường Đại học Bách khoa, nó giải đúng 100% luôn, còn DeepSeek R1 thì chưa cho up ảnh nên chưa thử được. Ngoài ra nó cũng vừa suy luận vừa search internet được giống như bật tính năng DeepThink (R1) + Search của DeepSeek. Khá ấn tượng đấy. Mình sẽ test thêm nhưng cơ bản thì khá ngang ngửa DeepSeek và o1 của OpenAI. Nhưng Kimi 1.5 có 1 số tính năng khác biệt so với DeepSeek R1 và cả o1 như sau để mọi người dễ hình dung:
-Dùng trên web, có bản cài trên Chrome và Destop nhưng chưa có API cho nhà phát triển
-Hỗ trợ tiếng Việt còn kém mặc dù hiểu nhưng output đôi khi chèn lẫn cả tiếng Trung. DeepSeek R1 hỗ trợ tiếng việt tốt hơn
-Kimi 1.5 mặc định có thể tìm kiếm trên web và có thể tìm hơn 100 trang web, trong đó nó đọc khá nhiều trang web tiếng Trung chứ không chỉ thuần là search web tiếng anh như các mô hình khác. bạn có thể market research thị trường Trung Quốc khổng lồ nhờ dùng Kimi 1.5 này.
-Xử lý đa phương thức, ngữ cảnh dài, phù hợp cho các tác vụ phức tạp như có thể phân tích được đc tối đa 50 tệp (đủ kiểu PDF, docs, ppt, hình ảnh,...) mỗi tệp tối đa , mỗi tệp có kích thước tối đa là 100 MB. Điều mà DeepSeek R1 chưa làm đc. Hiểu hình ảnh nâng cao, ko chỉ trích xuất văn bản cơ bản như mình test bằng ảnh chụp bài toán ở video demo nhanh ấy. Nó được giới thiệu là Vượt trội trong các tác vụ đa phương thức như MathVista (kết hợp hình ảnh và văn bản) đấy.
-Về điểm benchmark thì thấp hơn DeepSeek R1 chút, 1 -2 % thôi, ko quá khác biệt cái này lắm, cái quan trọng là Kimi 1.5 xử lý đa phương thức hữu dụng hơn nhiều hơn R1 chỉ thuần văn bản. Và 1 điểm là nó Hỗ trợ short-CoT (tối ưu tốc độ) và long-CoT (tối ưu độ chính xác)
Nói chung, Kimi k1.5 và DeepSeek R1 đại diện cho hai hướng phát triển khác nhau: Kimi tập trung vào đa phương thức và ngữ cảnh dài, trong khi DeepSeek R1 tối ưu hóa suy luận logic và mã nguồn mở. Tùy vào nhu cầu (xử lý đa phương thức vs. toán học/code), người dùng có thể lựa chọn mô hình phù hợp.
Gợi ý bạn ứng dụng thực tế 2 mô hình này như sau:
-Kimi k1.5: Phù hợp cho giáo dục (giải toán đa phương thức), phân tích dữ liệu hình ảnh-văn bản kết hợp, và các tác vụ đòi hỏi hiểu biết sâu về ngữ cảnh dài.
-DeepSeek R1: Tối ưu cho nghiên cứu khoa học, phát triển phần mềm (tự động sửa lỗi code), và các bài toán logic phức tạp
Ok đã hết, mn test thêm em này nhé, cũng ok phết đó
😘
 
Một bài phân tích vì sao DeepSeek của Trung Quốc lại đang gây chấn động:

1. Trước tiên, một chút bối cảnh: Hiện nay, việc huấn luyện các mô hình AI hàng đầu CỰC KỲ tốn kém. OpenAI, Anthropic, v.v. chi hơn 100 triệu USD chỉ để tính toán. Họ cần các trung tâm dữ liệu khổng lồ với hàng ngàn GPU trị giá 40.000 USD mỗi chiếc. Giống như cần cả một nhà máy điện để vận hành một nhà máy sản xuất.

2. DeepSeek xuất hiện và nói: "LOL, nếu chúng tôi làm việc này với 5 triệu USD thì sao?" Và họ không chỉ nói - họ thực sự đã LÀM được. Các mô hình của họ sánh ngang hoặc vượt qua GPT-4 và Claude trong nhiều nhiệm vụ. Thế giới AI đang (như các bạn trẻ nói) "sốc toàn tập".

3. Làm thế nào? Họ đã suy nghĩ lại mọi thứ từ đầu. AI truyền thống giống như viết mọi con số với 32 chữ số thập phân. DeepSeek thì nói: "nếu chỉ dùng 8 chữ số thì sao? Vẫn đủ chính xác đấy!" Boom - giảm 75% bộ nhớ cần thiết.

4. Tiếp đó là hệ thống "đa token" của họ. AI thông thường đọc như học sinh lớp một: "Con... mèo... ngồi..." DeepSeek đọc cả cụm từ cùng lúc. Nhanh gấp đôi, chính xác 90%. Khi bạn xử lý hàng tỷ từ, điều này rất QUAN TRỌNG.

5. Nhưng đây mới là phần thông minh nhất: Họ xây dựng một "hệ thống chuyên gia". Thay vì một AI khổng lồ cố gắng biết mọi thứ (giống như bắt một người vừa làm bác sĩ, luật sư, vừa làm kỹ sư), họ có các chuyên gia chuyên biệt chỉ hoạt động khi cần.

6. Các mô hình truyền thống? Tất cả 1,8 nghìn tỷ tham số luôn hoạt động. DeepSeek? Tổng cộng 671 tỷ, nhưng chỉ 37 tỷ hoạt động cùng lúc. Giống như có một đội lớn nhưng chỉ gọi đúng chuyên gia cần thiết cho từng nhiệm vụ.

7. Kết quả rất đáng kinh ngạc:

Chi phí huấn luyện: 100 triệu USD → 5 triệu USD

GPU cần thiết: 100.000 → 2.000

Chi phí API: giảm 95%

Có thể chạy trên GPU chơi game thay vì phần cứng trung tâm dữ liệu

8. "Nhưng đợi đã," bạn có thể nói, "chắc phải có điều gì đó không ổn!" Điều bất ngờ là - tất cả đều mã nguồn mở. Bất kỳ ai cũng có thể kiểm tra. Mã nguồn được công khai. Các bài báo kỹ thuật giải thích tất cả. Không phải phép thuật, chỉ là kỹ thuật cực kỳ thông minh.

9. Tại sao điều này quan trọng? Vì nó phá vỡ mô hình "chỉ các công ty công nghệ lớn mới chơi được AI." Bạn không còn cần một trung tâm dữ liệu trị giá hàng tỷ USD nữa. Chỉ cần một vài GPU tốt là đủ.

10. Với Nvidia, điều này thật đáng sợ. Toàn bộ mô hình kinh doanh của họ dựa vào việc bán GPU siêu đắt với biên lợi nhuận 90%. Nếu mọi người đột nhiên có thể làm AI với GPU chơi game thông thường... bạn hiểu vấn đề rồi đấy.

11. Và đây là điểm thú vị: DeepSeek đã làm điều này với đội ngũ dưới 200 người. Trong khi đó, Meta có những đội ngũ với chi phí trả lương thôi cũng vượt ngân sách huấn luyện toàn bộ của DeepSeek... mà các mô hình của họ vẫn không tốt bằng.

12. Đây là câu chuyện kinh điển về sự phá vỡ: Các công ty lâu đời tối ưu hóa quy trình hiện có, còn các công ty phá vỡ suy nghĩ lại cách tiếp cận từ gốc. DeepSeek hỏi: "Nếu chúng ta làm thông minh hơn thay vì ném thêm phần cứng vào thì sao?"

13. Ý nghĩa rất lớn:

Phát triển AI trở nên dễ tiếp cận hơn

Cạnh tranh tăng lên đáng kể

"Hào" bảo vệ của các công ty lớn trông giống như những vũng nước nhỏ

Yêu cầu phần cứng (và chi phí) giảm mạnh

14. Tất nhiên, những gã khổng lồ như OpenAI và Anthropic sẽ không đứng yên. Họ có lẽ đã bắt đầu áp dụng những đổi mới này. Nhưng "thần đèn" hiệu quả đã ra khỏi chai - không còn đường quay lại cách tiếp cận "ném thêm GPU" nữa.

15. Suy nghĩ cuối cùng: Đây có vẻ là một trong những khoảnh khắc mà chúng ta sẽ nhìn lại như một điểm ngoặt. Giống như khi máy tính cá nhân làm máy chủ chính trở nên kém quan trọng, hoặc khi điện toán đám mây thay đổi mọi thứ.

AI sắp trở nên dễ tiếp cận hơn nhiều và rẻ hơn rất nhiều. Câu hỏi không phải là liệu điều này có làm xáo trộn các bên hiện tại hay không, mà là nhanh đến mức nào.

Dùng thử đi rồi hẵng chửi những anh rồ mỹ anti tàu. Không tự nhiên mà
Hợp đồng tương lai Nasdaq 100 giảm ngay 300 điểm, tất cả cổ phiếu các hãng công nghệ mỹ chao đảo khi Deepseek ra mắt và chiếm vị trí số 1 trên app store .
Chi phí đầu tư rẻ hơn nhiều lần, cho dùng free , được đánh giá thông minh hơn nhiều Chatgpt.
 
Ròi cũng như ASIC hồi xưa thôi, xưa dùng GPU cày đắt vãi cứt và tốn điện. Tàu nó ra mấy quả ASIC cái là farm coin bùng nổ luôn.
Định hướng của Tàu với AI này cũng thế, bọn nó đang nghiên cứu "ASIC" chuyên dụng train AI. Nó mà ra dc mấy quả giá rẻ thì AI phổ cập cmnl
BdgiW7R.png
ASIC train AI là hướng đi chắc chắn chúng nó sẽ đi rồi
 
Lại là Rồng à. Lấy acc chính vào đi, sao phải lấy clone vậy :sad:
sao ngáo ngơ thế ? Đám Hàn, Đài, Trung có ngàn người cỡ như Vũ Hà Văn này. Rồi mấy giải toán đó có giúp ích dc cái gì ko ? Đc Vin thuê về nước lập mấy cty rác rưởi cức đái như Vin Bigdata rồi Vin Brain, sắp tới Vin Robotic, Vin Motion, toàn bánh vẽ, chả có tác dụng gì, thành lập dc vài 3 năm xong vội vàng bán đi mà chả để lại đc thành tựu đéo nào. Người ngoài cuộc ai cũng biết là các Cty rác rưởi bán đi để rửa tiền, Mày đừng lôi hạng vô dụng như Vũ Hà Văn vào nghe khắm lắm.
Một bài phân tích vì sao DeepSeek của Trung Quốc lại đang gây chấn động:

1. Trước tiên, một chút bối cảnh: Hiện nay, việc huấn luyện các mô hình AI hàng đầu CỰC KỲ tốn kém. OpenAI, Anthropic, v.v. chi hơn 100 triệu USD chỉ để tính toán. Họ cần các trung tâm dữ liệu khổng lồ với hàng ngàn GPU trị giá 40.000 USD mỗi chiếc. Giống như cần cả một nhà máy điện để vận hành một nhà máy sản xuất.

2. DeepSeek xuất hiện và nói: "LOL, nếu chúng tôi làm việc này với 5 triệu USD thì sao?" Và họ không chỉ nói - họ thực sự đã LÀM được. Các mô hình của họ sánh ngang hoặc vượt qua GPT-4 và Claude trong nhiều nhiệm vụ. Thế giới AI đang (như các bạn trẻ nói) "sốc toàn tập".
+1 tỏi, thông tin rất hữu ích đó bác.
 

Thống kê chủ đề

Ngày tạo
Zaunite,
Người trả lời cuối
Jaeho Kouki,
Trả lời
2.993
Lượt xem
519.756
Quay lại
Lên đầu trang