thảo luận Deepseek AI vào hết đây

  • Người tạo chủ đề Người tạo chủ đề Zaunite
  • Ngày bắt đầu Ngày bắt đầu
ko biết phải do mạng ko nhưng thường ban ngày chạy rất hay dính, tầm 1h đến sáng thì ko bị đâu, chạy thỉnh thoảng mới bị busy.
Giờ thì bị cả như này nữa
1738496330784.png

:burn_joss_stick: :burn_joss_stick: :burn_joss_stick:
 
Con DS này đưa code cho nó sửa lỗi mà nhìn nó suy nghĩ viết ra chắc mấy trang giấy chưa ra nữa nhìn như Giáo Sư hơn 15 phút xong lỗi cũ fix lòi ra lỗi mới trong khi ChatGPT-o3 nhanh hơn có 2-3 phút mà lỗi vẫn còn , vậy con nào ngon
 
Con DS này đưa code cho nó sửa lỗi mà nhìn nó suy nghĩ viết ra chắc mấy trang giấy chưa ra nữa nhìn như Giáo Sư hơn 15 phút xong lỗi cũ fix lòi ra lỗi mới trong khi ChatGPT-o3 nhanh hơn có 2-3 phút mà lỗi vẫn còn , vậy con nào n
DS trả lời

"Khi so sánh khả năng debug code của các AI như DeepSeek, ChatGPT-3.5 hay các công cụ khác, cần xem xét một số yếu tố:

### 1. Nguyên nhân lỗi không được fix triệt để:
  • Thiếu context: AI thường chỉ xử lý đoạn code bạn cung cấp. Nếu lỗi liên quan đến phần khác (biến toàn cục, API, thư viện...), AI sẽ không thể fix chính xác.
  • Logic phức tạp: AI có thể "đoán mò" nếu code của bạn chứa nghiệp vụ đặc thù hoặc thuật toán phức tạp.
  • Giới hạn training: Mô hình được train trên dữ liệu công khai, nên những lỗi ít phổ biến hoặc code "độc đáo" dễ bị xử lý sai.

### 2. So sánh các công cụ:
- ChatGPT-3.5 (miễn phí):
- Ưu điểm: Nhanh, phản hồi ngắn gọn, phù hợp lỗi đơn giản.
- Nhược điểm: Dễ mắc lỗi logic, thiếu chiều sâu khi phân tích.
- DeepSeek (hoặc mô hình chuyên code như CodeLlama):
- Ưu điểm: Tập trung vào code, đôi khi phân tích kỹ hơn.
- Nhược điểm: Dài dòng, có thể overcomplicate vấn đề.
- GPT-4/ChatGPT Plus (trả phí):
- Tốt hơn hẳn: Khả năng hiểu context sâu, ít mắc lỗi mới khi fix, xử lý được code phức tạp.

### 3. Cách tối ưu khi dùng AI để debug:
  • Cung cấp đủ thông tin: Include lỗi cụ thể (error message), input/output mong đợi, và cả đoạn code liên quan.
  • Chia nhỏ vấn đề: Đừng yêu cầu fix nguyên file dài. Tách thành hàm/class nhỏ và debug từng phần.
  • Kiểm tra từng bước: Sau khi AI đưa code fix, hãy chạy thử và hỏi tiếp về lỗi mới xuất hiện.
  • Kết hợp công cụ: Dùng AI cùng với linter (ESLint, Pylint) hoặc IDE (VS Code, PyCharm) để phát hiện lỗi cú pháp ngay lập tức.

### 4. Gợi ý công cụ hỗn hợp:
  • GitHub Copilot: Tích hợp trực tiếp vào IDE, đề xuất fix lỗi theo ngữ cảnh.
  • Phản biện AI: Dùng ChatGPT hoặc DeepSeek để phân tích code của nhau. Ví dụ: "Kiểm tra xem code sau từ DeepSeek có tiềm ẩn lỗi gì không?"

### Kết luận:
Nếu cần fix lỗi nhanh cho code đơn giản, ChatGPT-3.5 đủ dùng. Với logic phức tạp, hãy ưu tiên GPT-4 hoặc kết hợp nhiều công cụ. Quan trọng nhất vẫn là hiểu code và tự kiểm tra—AI chỉ hỗ trợ, không thay thế được tư duy của developer."
 

Không phải 6 triệu USD, DeepSeek cần tiêu tốn ít nhất 500 triệu USD để phát triển mô hình AI​

DeepSeek, startup AI của Trung Quốc, đã trở thành tâm điểm của giới công nghệ trong tuần này, với sự chú ý đổ dồn vào một con số duy nhất: 6 triệu USD. Trong bài báo về mô hình AI mới nhất của mình, DeepSeek cho biết tổng chi phí huấn luyện chỉ vỏn vẹn 5,576 triệu USD, dựa trên giá thuê các GPU của NVIDIA.

Tuy nhiên, họ cũng đưa ra một điều kiện rõ ràng rằng con số này chỉ bao gồm quá trình "huấn luyện chính thức" của mô hình, không tính đến các chi phí liên quan đến "nghiên cứu trước đó và thử nghiệm loại bỏ về kiến trúc, thuật toán hay dữ liệu".

Đầu tuần này, trợ lý AI của DeepSeek đã soán ngôi vị ứng dụng miễn phí được tải nhiều nhất tại Mỹ trên App Store của Apple, vượt qua ChatGPT của OpenAI. Thị trường chứng khoán công nghệ toàn cầu đã chao đảo, với các nhà sản xuất chip như NVIDIA và Broadcom mất tổng cộng 800 tỷ USD vốn hóa thị trường vào thứ Hai.



Không phải 6 triệu USD, DeepSeek cần tiêu tốn ít nhất 500 triệu USD để phát triển mô hình AI- Ảnh 1.
Chỉ trong một tuần, DeepSeek đã làm giới công nghệ Mỹ chao đảo



Một báo cáo mới từ SemiAnalysis, công ty nghiên cứu và tư vấn về bán dẫn, đã cung cấp thêm các ước tính về chi phí của DeepSeek. Công ty này ước tính rằng chi phí phần cứng của DeepSeek "cao hơn nhiều so với 500 triệu USD tính trong toàn bộ lịch sử công ty", đồng thời nhấn mạnh rằng chi phí R&D và tổng chi phí sở hữu cũng rất đáng kể. Việc tạo ra "dữ liệu tổng hợp" để mô hình huấn luyện sẽ đòi hỏi "một lượng tính toán đáng kể", SemiAnalysis cho biết.

Báo cáo cũng chỉ ra rằng chi phí để huấn luyện mô hình Claude 3.5 Sonnet từ Anthropic lên tới "hàng chục triệu USD", nhưng lưu ý rằng Anthropic đã huy động được hàng tỷ USD từ Amazon và Google, một dấu hiệu cho thấy cần thêm nhiều tiền hơn nữa để vận hành các mô hình và công ty. "Đó là bởi vì họ phải thử nghiệm, đưa ra các kiến trúc mới, thu thập và làm sạch dữ liệu, trả lương nhân viên, và nhiều thứ khác nữa", SemiAnalysis giải thích.


Theo SemiAnalysis, con số này có thể lên tới 1,6 tỷ USD: “Phân tích của chúng tôi cho thấy tổng chi phí vốn máy chủ cho DeepSeek là xấp xỉ 1,6 tỷ USD, với một phần đáng kể lên tới 944 triệu USD liên quan đến việc vận hành các cụm như vậy.”

Chính bài báo của DeepSeek cũng không đưa ra ước tính về chi phí tính toán của họ. Công ty chưa ngay lập tức phản hồi yêu cầu bình luận. "Rõ ràng DeepSeek là duy nhất ở chỗ họ đạt được mức chi phí và năng lực này đầu tiên", SemiAnalysts viết. Công ty này cũng bổ sung rằng R1 của DeepSeek "là một mô hình rất tốt" và việc "bắt kịp được năng lực lập luận nhanh đến vậy là rất ấn tượng".

Các chuyên gia và nhà phân tích trong tuần này đã ca ngợi chất lượng mô hình của DeepSeek, đồng thời chỉ ra điều này ấn tượng như thế nào khi xét đến việc Mỹ đã 3 lần hạn chế xuất khẩu chip sang Trung Quốc trong 3 năm qua. Điều này dẫn đến lo ngại rằng Mỹ đang tụt lại phía sau đối thủ chính của mình trong một thị trường được dự báo sẽ vượt quá 1 nghìn tỷ USD doanh thu trong vòng một thập kỷ tới.



Không phải 6 triệu USD, DeepSeek cần tiêu tốn ít nhất 500 triệu USD để phát triển mô hình AI- Ảnh 2.


DeepSeek được thành lập năm 2023 bởi Lương Văn Phong, đồng sáng lập quỹ đầu cơ định lượng High-Flyer, tập trung vào AI. Theo các nhà phân tích tại Jefferies, công ty khởi nghiệp AI này được cho là tách ra từ đơn vị nghiên cứu AI của quỹ đầu cơ vào tháng 4/2023 để tập trung vào các mô hình ngôn ngữ lớn và theo đuổi trí tuệ nhân tạo phổ quát (AGI) - một nhánh của AI có khả năng ngang bằng hoặc vượt trội hơn trí tuệ con người trong nhiều tác vụ, mục tiêu mà OpenAI và các công ty khác cũng đang theo đuổi. DeepSeek vẫn hoàn toàn thuộc sở hữu và được tài trợ bởi High-Flyer.

Sự quan tâm xung quanh DeepSeek bắt đầu tăng mạnh từ đầu tháng này, khi công ty khởi nghiệp ra mắt R1, một mô hình suy luận cạnh tranh với o1 của OpenAI. Đây là một mô hình mã nguồn mở, có nghĩa là bất kỳ nhà phát triển AI nào cũng có thể sử dụng. Tương tự như các chatbot Trung Quốc khác, DeepSeek cũng có những hạn chế về một số chủ đề nhất định: Chẳng hạn, khi được hỏi về chính trị, DeepSeek được cho là đã hướng người dùng tránh xa những câu hỏi tương tự.

CEO của OpenAI, Sam Altman, đã công khai khen ngợi mô hình này, nhưng công ty cũng cho biết họ tin rằng có bằng chứng cho thấy DeepSeek đã thu thập dữ liệu của OpenAI một cách không đúng đắn để xây dựng sản phẩm. Tại một sự kiện ở Washington, D.C., vào thứ Năm do OpenAI tổ chức, Altman nói rằng DeepSeek "rõ ràng là một mô hình tuyệt vời". "Đây là lời nhắc nhở về mức độ cạnh tranh và sự cần thiết để AI đại chúng chiến thắng", ông nói. Ông cũng chỉ ra "mức độ quan tâm đến khả năng suy luận, mức độ quan tâm đến mã nguồn mở".

 

Không phải 6 triệu USD, DeepSeek cần tiêu tốn ít nhất 500 triệu USD để phát triển mô hình AI​



Đám báo chí tây rảnh dé thật. Trong paper nói rõ 5.xx củ U chi phí train rồi. Liên quan gì chi phí phần cứng hay lương hay data đâu:whistle:
 

Tại sao 'chưng cất' đang trở thành từ đáng sợ nhất với các công ty AI tiên phong?​


Dù chưng cất là một kỹ thuật đã được ứng dụng rộng rãi, nhưng việc DeepSeek tận dụng phương pháp này để phát triển mô hình AI của họ đã gây tranh cãi​





Trong cuộc đua phát triển trí tuệ nhân tạo, các công ty tiên phong như OpenAI, Google, Meta hay Anthropic đã đầu tư hàng tỷ USD để xây dựng những mô hình ngôn ngữ lớn với quy mô khổng lồ, tin rằng đó là con đường duy nhất để duy trì vị thế dẫn đầu. Tuy nhiên, sự xuất hiện của những đối thủ mới, đặc biệt là DeepSeek, đang đặt ra một câu hỏi quan trọng: liệu những khoản đầu tư khổng lồ đó có thực sự tạo ra lợi thế lâu dài, hay chỉ là bàn đạp cho những công ty đi sau tận dụng?

Phương pháp "chưng cất" (distillation) chính là yếu tố thay đổi cục diện. Đây là kỹ thuật giúp các mô hình nhỏ hơn có thể học hỏi từ các mô hình lớn mà không cần trải qua quá trình đào tạo từ đầu trên dữ liệu thô. Thay vì mất hàng tháng và tiêu tốn hàng chục triệu USD để phát triển một mô hình AI, một công ty mới có thể sử dụng đầu ra từ các mô hình đã có để huấn luyện một phiên bản nhỏ gọn hơn, đạt hiệu suất tương đương với chi phí thấp hơn nhiều.



Tại sao 'chưng cất' đang trở thành từ đáng sợ nhất với các công ty AI tiên phong?- Ảnh 1.


Khái niệm chưng cất trong AI có thể hiểu đơn giản là sự "chuyển giao kiến thức" từ một mô hình lớn (giáo viên) sang một mô hình nhỏ hơn (học sinh). Microsoft đã mô tả kỹ thuật này như một phương pháp giúp các mô hình nhỏ duy trì chất lượng cao của các mô hình lớn nhưng với chi phí suy luận thấp hơn đáng kể. Nhờ đó, AI có thể vận hành hiệu quả trên các thiết bị nhỏ gọn hoặc trong môi trường có tài nguyên hạn chế.

Sự quan tâm đến chưng cất không chỉ dừng lại ở lĩnh vực xử lý ngôn ngữ tự nhiên mà còn lan rộng sang các ứng dụng khác, đặc biệt là xe tự lái. Các nhà nghiên cứu đã sử dụng chưng cất để chuyển giao khả năng nhận diện hình ảnh từ những mô hình phức tạp sang các hệ thống AI nhẹ hơn, tối ưu hóa cho việc xử lý dữ liệu theo thời gian thực mà vẫn đảm bảo hiệu suất cao. Điều này giúp cải thiện khả năng phát hiện vật thể, hợp nhất dữ liệu cảm biến và ra quyết định một cách nhanh chóng và tiết kiệm năng lượng.

Căng thẳng giữa OpenAI và DeepSeek


Dù chưng cất là một kỹ thuật đã được ứng dụng rộng rãi, nhưng việc DeepSeek tận dụng phương pháp này để phát triển mô hình AI của họ đã gây tranh cãi. Ngày 29/1, OpenAI tuyên bố đã phát hiện dấu hiệu cho thấy DeepSeek có thể đã sử dụng kỹ thuật chưng cất để học từ mô hình của họ, điều có thể vi phạm điều khoản dịch vụ. Microsoft, đối tác lớn của OpenAI, cũng đã điều tra và chặn các tài khoản được cho là của DeepSeek do nghi ngờ khai thác API của OpenAI để thu thập dữ liệu.

David Sacks, cố vấn về AI và tiền điện tử của Tổng thống Mỹ, cho biết "có bằng chứng đáng kể" về việc DeepSeek sử dụng chưng cất theo cách có thể gây tổn hại đến các công ty AI hàng đầu của Mỹ. Ông cũng nhấn mạnh rằng trong thời gian tới, các công ty AI lớn sẽ tìm cách ngăn chặn chưng cất để hạn chế sự phát triển của các mô hình AI "copycat". Đây không chỉ là một vấn đề cạnh tranh thương mại mà còn liên quan đến cuộc đua địa chính trị về quyền kiểm soát công nghệ AI.

"Chưng cất" có thể làm lung lay thế độc quyền?

Sự phát triển nhanh chóng của DeepSeek đã buộc các nhà lãnh đạo AI tại Thung lũng Silicon phải đánh giá lại chiến lược kinh doanh của họ. Mike Volpi, một nhà đầu tư công nghệ kỳ cựu, đặt câu hỏi: "Liệu có hiệu quả kinh tế khi đi đầu trong lĩnh vực với chi phí cao gấp 8 lần so với những công ty đang theo sau một cách nhanh chóng?"

Sam Altman, CEO OpenAI, cũng thừa nhận trên X rằng mô hình của DeepSeek rất "ấn tượng, đặc biệt là về mức giá," nhưng vẫn khẳng định OpenAI sẽ tiếp tục con đường nghiên cứu của riêng mình.

Yann LeCun, Giám đốc AI của Meta, thì cho rằng có sự hiểu lầm lớn khi so sánh chi phí phát triển AI của các công ty Mỹ với DeepSeek. Ông chỉ ra rằng phần lớn số tiền đầu tư của OpenAI, Google hay Meta không dành cho việc đào tạo mô hình, mà là để vận hành và duy trì hiệu suất của hệ thống. Trong khi đó, CEO Anthropic Dario Amodei cho rằng những gì DeepSeek làm không phải là một đột phá mang tính cách mạng, mà chỉ đơn giản là một bước đi hợp lý trong xu hướng giảm chi phí AI đang diễn ra.

Những thay đổi này có thể dẫn đến một cuộc tái cấu trúc toàn bộ ngành AI, khi các mô hình lớn không còn là điều kiện bắt buộc để dẫn đầu, mà thay vào đó, khả năng tối ưu hóa và khai thác kiến thức từ các mô hình đã có sẵn sẽ quyết định ai là người chiến thắng.

 

Thống kê chủ đề

Ngày tạo
Zaunite,
Người trả lời cuối
Jaeho Kouki,
Trả lời
2.993
Lượt xem
519.915
Quay lại
Lên đầu trang