Lại cháy nữa lên ae, lại có thêm 1 mô hình Kimi k1.5. Một mô hình đa phương thức cấp độ o1
-Hiệu suất Short-CoT (Chuỗi suy luận ngắn) vượt trội, vượt xa GPT-4o và Claude Sonnet 3.5 trong các bài kiểm tra
AIME,
LiveCodeBench với tỷ lệ chênh lệch lớn (lên đến +550%)
-Hiệu suất Long-CoT (Chuỗi suy luận dài) tương đương với o1 trên nhiều phương thức (
MathVista,
Codeforces, v.v.)
Báo cáo kỹ thuật: i-k1.5...
Các thành phần chính của k1.5:
-Khả năng mở rộng ngữ cảnh dài. Hỗ trợ đến 128k tokens cho việc sinh RL (Reinforcement Learning). Huấn luyện hiệu quả với partial rollouts.
-Tối ưu hóa chính sách nâng cao: online mirror descent, chiến lược lấy mẫu, hệ số phạt độ dài, và các yếu tố khác.
-Đa phương thức. Suy luận kết hợp giữa văn bản và hình ảnh.
Nghiên cứu kỹ 2 paper về hai model cực khủng (DeepSeek R1 và Kimi 1.5) ngang tầm “o1-style” của các pháp sư Trung Hoa, tóm gọn lại thì như thế này:
1. Ý tưởng chung: Không còn “cồng kềnh” như trước
a) Bỏ Tree Search (MCTS), chỉ cần “nghĩ thẳng một dòng” (linearize)
• Trước giờ: Ta thường thấy AI “chiến” cờ vua, cờ vây dùng MCTS (Monte Carlo Tree Search) để tìm nước cờ ngon. Rất mạnh, nhưng code và tính toán khá phức tạp.
• Giờ: DeepSeek và Kimi đều bảo, “Trên thực tế, ta chỉ cần cho mô hình suy nghĩ theo mạch (chính là Chain of Thought) và dự đoán lần lượt (autoregressive) là đủ.”
• Ví dụ hình dung:
• Giả sử có một cậu bé học cờ vua, thay vì cậu ấy phải vẽ ra cả cái cây quyết định khổng lồ hàng chục nhánh (MCTS), cậu ấy chỉ cần suy luận tuần tự: “Đi tốt lên, đối thủ sẽ làm gì?, Mình phản ứng thế nào?”… cứ thế nối tiếp một đường suy nghĩ ngắn-gọn-mà-trúng.
b) Không cần thêm mạng giá trị (Value Network) cồng kềnh
• Ngày xưa: Trong RL kiểu cũ, ta thường có hai mạng to tướng: một mạng để “ra quyết định” (policy network) và một mạng để “định giá, đo lợi hại” (value network).
• Giờ: Hai nhóm này bảo, không cần phải tách riêng cái value network kia. Vì huấn luyện song song hai “con quái vật” to đùng rất tốn sức (tiền điện, GPU, thời gian…).
• Thực tế: Họ dùng luôn chính mô hình chính (policy) hoặc vài thủ thuật đánh giá đơn giản để thay thế. Thế là tiết kiệm rất nhiều.
c) Tập trung vào kết quả cuối (End Result) hơn là chấm điểm tí tí (Dense Reward)
• Thường thấy: Mọi người thích “chấm điểm” mô hình ở mỗi bước (dense reward) hay dùng “mô hình reward” riêng để phân biệt câu trả lời nào tốt hơn.
• Hai nhóm: Gợi ý “Cứ nhìn chung cuộc xem đúng sai, được hay không” – kiểu như AlphaZero chỉ quan tâm “thắng” hay “thua” cuối. Hạn chế bớt can thiệp chi li, mô hình sẽ học “lối tư duy” một cách tự nhiên hơn (và bớt phức tạp).
• Ví dụ: Học đá bóng, thay vì huấn luyện AI mà cứ 5 giây cho thêm/giảm 1 điểm, ở đây họ bảo “chỉ cần nhìn tỉ số chung cuộc” (thắng thua) là cũng đủ để AI tự rút kinh nghiệm.
2. Sự khác nhau giữa DeepSeek R1 và Kimi 1.5
a) Khởi động (Bootstrapping) khác biệt
1. DeepSeek R1:
• “Cold start” kiểu AlphaZero: Tự mày mò từ đầu, không (hoặc rất ít) dữ liệu được “dạy trước” bởi con người.
• Thoạt nghe hơi cực đoan, nhưng nếu chạy lâu, chịu khó “cày” thì có thể đạt level rất cao (như AlphaZero đánh bại AlphaGo).
2. Kimi 1.5:
• Dùng “mồi” trước (SFT – Supervised Fine-tuning) kiểu AlphaGo Master: Lấy một ít dữ liệu đã gắn nhãn (ví dụ những “hướng suy luận CoT” do con người soạn) để huấn luyện nhanh buổi đầu, rồi mới chuyển sang RL.
• Kết quả cho thấy mô hình này “lên tay” nhanh hơn, nhất là trong mấy bài toán phức tạp.
b) Cấp độ mở (Open Source) & Giấy phép
• DeepSeek: Công bố toàn bộ trọng số (weights) theo giấy phép MIT – cực kỳ thoáng, ai cũng xài được. Đây là nước đi “chơi lớn” để cộng đồng tha hồ tùy biến.
• Kimi: Hiện chưa phát hành mô hình chính thức. Chỉ công bố paper với nhiều chi tiết kỹ thuật. Ai muốn chạy thử “chính chủ” thì chắc phải… chờ.
c) Tính năng đa phương thức (Multimodal)
• Kimi 1.5 được báo cáo là xử lý tốt nhiều kiểu dữ liệu (văn bản, hình ảnh, biểu đồ, câu đố IQ, hình học…) – họ đưa ra thí nghiệm với MathVista, nơi phải nhìn và hiểu hình rồi giải bài toán.
• DeepSeek chưa đề cập nhiều phần này, hoặc chưa công bố kết quả. Có thể họ đang tập trung vào khía cạnh khác.
d) Chi tiết triển khai: Kimi “kể” nhiều, DeepSeek “kể” ít
• Kimi:
• Paper khá dày, mô tả từ hạ tầng RL (làm cluster, song song ra sao),
• Tới code sandbox (cho mô hình tự viết code, chạy thử, check kết quả),
• Chiến lược nén CoT (vì context quá dài),
• Cách tạo “bài tập” cho mô hình dần khó hơn (curriculum),
• V.v.
• DeepSeek: Không chia sẻ quá sâu về cách họ xây hệ thống, nhưng bù lại mở luôn trọng số để community vọc.
3. Đọc xong, ta rút ra gì?
1. RL trên mô hình ngôn ngữ không phải lúc nào cũng cần những cơ chế phức tạp như MCTS, value network hay reward model riêng.
2. Cách tiếp cận “tối giản” (simple pipeline) + “dựa vào kết quả cuối” đang được cả DeepSeek và Kimi chứng minh là rất hiệu quả.
3. So sánh hai hướng:
• DeepSeek = “tôi tự chơi, tôi tự học, không cần ai nâng đỡ” (AlphaZero style),
• Kimi = “cho tôi tí ví dụ ban đầu để khởi động” (AlphaGo Master style).
4. DeepSeek “open” (MIT license), Kimi “kín” hơn về model, nhưng bù lại viết paper rất chi tiết.
5. Tương lai, chắc chắn cộng đồng sẽ khai thác hai mô hình (và các ý tưởng của họ) để nâng cấp những LLM hay mô hình đa phương thức khác.
Tóm gọn: Hai nghiên cứu này cho thấy: “Đôi khi cứ làm đơn giản, đừng làm phức tạp là tốt nhất”. Họ đưa minh chứng rõ ràng rằng cắt giảm những module rườm rà (tree search, value net, dense reward) lại cho kết quả tốt bất ngờ, miễn là ta huấn luyện đúng cách. Hơn nữa, việc chia sẻ (hoặc không) trọng số, và cách khởi động RL (có hay không có dữ liệu con người) sẽ quyết định mô hình nào phù hợp với mục tiêu, thời gian, và ngân sách tính toán của từng nhóm.
BÀI TIẾP
REVIEW nhanh Kimi 1.5 , mô hình ngang ngửa DeepSeek R1, cũng đến từ các pháp sư Trung Hoa
Ok như vậy là Kimi 1.5 đã chính thức mở cho người dùng sử dụng, chỉ cần đăng ký bằng số điện thoại là đc, khá nhanh. nếu bạn nghe đến cái tên này đầu tiên thì đây là 1 mô hình AI mạnh ngang ngửa DeepSeek R1 , công ty đứng đằng sau là MoonShot cũng rất mạnh, ra mắt gần như cùng 1 thời điểm nhưng nay họ mới mở cho mọi người dùng chính thức và miễn phí.
Mình vừa mới test nhanh khả năng giải toán tư duy , 1 bài mẫu từ bộ đề của Trường Đại học Bách khoa, nó giải đúng 100% luôn, còn DeepSeek R1 thì chưa cho up ảnh nên chưa thử được. Ngoài ra nó cũng vừa suy luận vừa search internet được giống như bật tính năng DeepThink (R1) + Search của DeepSeek. Khá ấn tượng đấy. Mình sẽ test thêm nhưng cơ bản thì khá ngang ngửa DeepSeek và o1 của OpenAI. Nhưng Kimi 1.5 có 1 số tính năng khác biệt so với DeepSeek R1 và cả o1 như sau để mọi người dễ hình dung:
-Dùng trên web, có bản cài trên Chrome và Destop nhưng chưa có API cho nhà phát triển
-Hỗ trợ tiếng Việt còn kém mặc dù hiểu nhưng output đôi khi chèn lẫn cả tiếng Trung. DeepSeek R1 hỗ trợ tiếng việt tốt hơn
-Kimi 1.5 mặc định có thể tìm kiếm trên web và có thể tìm hơn 100 trang web, trong đó nó đọc khá nhiều trang web tiếng Trung chứ không chỉ thuần là search web tiếng anh như các mô hình khác. bạn có thể market research thị trường Trung Quốc khổng lồ nhờ dùng Kimi 1.5 này.
-Xử lý đa phương thức, ngữ cảnh dài, phù hợp cho các tác vụ phức tạp như có thể phân tích được đc tối đa 50 tệp (đủ kiểu PDF, docs, ppt, hình ảnh,...) mỗi tệp tối đa , mỗi tệp có kích thước tối đa là 100 MB. Điều mà DeepSeek R1 chưa làm đc. Hiểu hình ảnh nâng cao, ko chỉ trích xuất văn bản cơ bản như mình test bằng ảnh chụp bài toán ở video demo nhanh ấy. Nó được giới thiệu là Vượt trội trong các tác vụ đa phương thức như MathVista (kết hợp hình ảnh và văn bản) đấy.
-Về điểm benchmark thì thấp hơn DeepSeek R1 chút, 1 -2 % thôi, ko quá khác biệt cái này lắm, cái quan trọng là Kimi 1.5 xử lý đa phương thức hữu dụng hơn nhiều hơn R1 chỉ thuần văn bản. Và 1 điểm là nó Hỗ trợ short-CoT (tối ưu tốc độ) và long-CoT (tối ưu độ chính xác)
Nói chung, Kimi k1.5 và DeepSeek R1 đại diện cho hai hướng phát triển khác nhau: Kimi tập trung vào đa phương thức và ngữ cảnh dài, trong khi DeepSeek R1 tối ưu hóa suy luận logic và mã nguồn mở. Tùy vào nhu cầu (xử lý đa phương thức vs. toán học/code), người dùng có thể lựa chọn mô hình phù hợp.
Gợi ý bạn ứng dụng thực tế 2 mô hình này như sau:
-Kimi k1.5: Phù hợp cho giáo dục (giải toán đa phương thức), phân tích dữ liệu hình ảnh-văn bản kết hợp, và các tác vụ đòi hỏi hiểu biết sâu về ngữ cảnh dài.
-DeepSeek R1: Tối ưu cho nghiên cứu khoa học, phát triển phần mềm (tự động sửa lỗi code), và các bài toán logic phức tạp
Ok đã hết, mn test thêm em này nhé, cũng ok phết đó