[Dịch] AI Trung Quốc bị tố “chuyển hướng” hội thoại sang Claude để luyện mô hình: Dữ liệu nhạy cảm, thậm chí bí mật quốc phòng, có nguy cơ bị lộ

Nếu bạn chê tôi thu nhập thấp thì tôi nhận. Tôi cũng thấy mình thấp với mức lương 50 triệu vnd hằng tháng.

Tôi muốn hỏi lần chót: bạn có trả lời được các câu hỏi của tôi không?

Tôi nói rõ: tôi không tham gia trò ngu của các bạn, không cần lặp lại câu hỏi hay mỉa mai, vô ích.
Thế chốt lại là k dám nhận kèo, k biết gì về AI nhưng vẫn wall of text thuyết âm mưu, đổ thừa chính trị klq đúng k :shame:

Tuởng thế nào, có nhõn 50 củ đã vội chê ng khác ngu loser. 50 củ hay 5 tệ/còm :shame:

1789284587397.webp

Ưng mạnh nhưng k dám hộ giá, hèn vay :shame:
 
Thế chốt lại là k dám nhận kèo, k biết gì về AI nhưng vẫn wall of text thuyết âm mưu, đổ thừa chính trị klq đúng k :shame:

Tuởng thế nào, có nhõn 50 củ đã vội chê ng khác ngu loser. 50 củ hay 5 tệ/còm :shame:

Xem tệp đính kèm 3794752
Ưng mạnh nhưng k dám hộ giá, hèn vay :shame:
Ai cá độ với bạn hãy tìm người đó. Tôi không có nghĩa vụ và trách nhiệm. Ngoài ra như tôi nói : nếu bạn giải thích được trò ngu của các bạn liên quan đến nội dung bài báo , hợp lý thì tôi tham gia.

Tôi hỏi lại: bạn không hề có kiến thức để trả lời phản hồi những comment kiến thức của tôi phải không?

Bạn có thể gọi những người ưng bạn để vào trả lời hộ bạn.
 
Ai cá độ với bạn hãy tìm người đó. Tôi không có nghĩa vụ và trách nhiệm.

Tôi hỏi lại: bạn không hề có kiến thức để trả lời phản hồi những comment kiến thức của tôi phải không?

Bạn có thể gọi những người ưng bạn để vào trả lời hộ bạn.
Không cần nói với bạn, cho phép bạn túc tiệp ngu
 
Distill là distill dữ liệu chứ có phải copy model đâu mà bug ẩn hay không hiểu logic vậy :))) Thằng nào chẳng phải nghiên cứu cấu trúc model riêng, distill là distill dữ liệu chứ copy cấu trúc model được thì giờ có Fable local chạy rồi :)))

Bọn nó không có $ thuê đám researcher ngon để quản lý dữ liệu đầu vào, đầu ra của model nên lấy luôn dữ liệu từ model mẹ chứ sao :))) Mà thật ra trò này thằng GPT là thằng đầu tiên làm, để sinh ra đám model con giá rẻ cho output nhanh nhưng mà thằng DeepSeek nó nâng tầm lên thành kĩ thuật cho output hiệu quả chứ không chỉ nhanh nhữa :))
Đúng là Distill dữ liệu không phải copy model nhưng dữ liệu từ đầu đến cuối đều là Distill thì:
Dữ liệu chính là Mô hình" (Data IS the Model). Copy chuỗi suy luận từ Claude/GPT nghĩa là anh đang copy bản đồ tư duy bọn nó.

Kiến trúc Model chỉ là cái khung nhà, data mới là bộ não. Đúng là anh tự thiết kế cái khung, anh nắm được nền tảng của nó. Nhưng khả năng giải toán, viết code, tư duy logic của mô hình lại nằm ở hàng trăm tỷ trọng số được hình thành từ dữ liệu chưng cất. Không có dữ liệu distill đó, lấy cái kiến trúc "tự nghiên cứu" đó học từ dữ liệu gốc xem có ra được cái gì không?

Hơn nữa, còn có 1 vấn đề của Distill là copy luôn Bug tư duy: Khi anh lấy chuỗi suy luận từ Claude/GPT về để train, mô hình của anh sẽ học vẹt nguyên vẹn các lỗ hổng logic, các điểm mù kiến thức, và cả ảo giác đặc thù của mô hình mẹ. Kỹ sư của anh tự viết cái khung, nhưng hoàn toàn không hiểu tại sao mô hình con lại ra kết quả sai ở trường hợp đó, vì logic đó là do mô hình mẹ mớm cho, chứ kỹ sư có tự tạo ra dữ liệu gốc đâu mà đòi hiểu bản chất để fix bug?

Btw, ý kiến tôi thế này: distill dữ liệu lẫn nhau không phải là vấn đề, chuyện bình thường trong ngành, vấn đề là mức độ phụ thuộc bao nhiêu? Phụ thuộc đến mức nào mà không có bộ lọc chuyển hướng định hướng, cơ chế kiểm duyệt dữ liệu, đến mức leak cả dữ liệu tuyệt mật?
 
Sửa lần cuối:
Hơn nữa, còn có 1 vấn đề của Distill là copy luôn Bug tư duy: Khi anh lấy chuỗi suy luận từ Claude/GPT về để train, mô hình của anh sẽ học vẹt nguyên vẹn các lỗ hổng logic, các điểm mù kiến thức, và cả ảo giác đặc thù của mô hình mẹ. Kỹ sư của anh tự viết cái khung, nhưng hoàn toàn không hiểu tại sao mô hình con lại ra kết quả sai ở trường hợp đó — vì logic đó là do mô hình mẹ mớm cho, chứ kỹ sư có tự tạo ra dữ liệu gốc đâu mà đòi hiểu bản chất để fix bug?

Hallucination bọn nó có bench riêng để đo mà :)))
Mà thực tế đám model Tàu trừ con DeepSeek có hallucination rate cao ngất ngưởng ngang 5.6 Sol, thì mấy con Kimi, GLM, Qwen, MiniMax có hallucination rate ổn định hơn nhiều :)))

Mỗi model có cách xử lý hallucination riêng nên bench mới khác nhau 1 trời 1 vực vậy
 

Tệp đính kèm

  • 1789285763453.webp
    1789285763453.webp
    70,8 KB · Lượt xem: 2
Tôi không rõ nhưng tôi nói đổng bạn vậy . Bạn nói đổng về cá nhân tôi được , tôi nói bạn thế còn quá nhẹ.

Đừng nói chuyện khoa học bằng những từ ngu như vậy.
Còn mục đích khác khoa học thì có thể nói ngu. Chính trị gia chưa bao giờ nói câu nào khôn.
Mất trí nhớ nhanh quá. Mới page 1 nói ngưòi khác ngu nhưng giờ lại thành nạn nhân rồi.

Khiếp thu nhập cao quá đã vội chửi ng khác ngu rồi k thành công rồi. Chịu đấy.

50 củ chắc vừa khít bảo duỡng con Lex của t già tận 2 lần, vậy là thành công zoi :shame:

 
Hallucination bọn nó có bench riêng để đo mà :)))
Mà thực tế đám model Tàu trừ con DeepSeek có hallucination rate cao ngất ngưởng ngang 5.6 Sol, thì mấy con Kimi, GLM, Qwen, MiniMax có hallucination rate ổn định hơn nhiều :)))

Mỗi model có cách xử lý hallucination riêng nên bench mới khác nhau 1 trời 1 vực vậy
Điểm số hallucination thấp hay cao chỉ phản ánh chiến lược làm sạch/chặn dữ liệu đầu ra (Guardrails) của từng hãng.

Khi distill dữ liệu, các mô hình con kế thừa luôn cả cơ chế ảo giác gốc của mô hình mẹ. Để điểm benchmark không bị xấu, các công ty phải đắp thêm các lớp lọc (Guardrails) dày đặc ở đầu ra.

==> Cơ chế ảo giác vẫn còn đó chỉ thêm vào cơ chế giấu/không giấu. Người dùng thấy mô hình có vẻ ít bốc phét hơn, nhưng thực ra đó chỉ là một model bị cài quá nhiều bộ lọc. Khi gặp các bài toán thực tế phức tạp ngoài đời, ngoài khung benchmark, cơ chế ảo giác bên dưới sẽ lộ ra ngay
 
Điểm số hallucination thấp hay cao chỉ phản ánh chiến lược làm sạch/chặn dữ liệu đầu ra (Guardrails) của từng hãng.

Khi distill dữ liệu, các mô hình con kế thừa luôn cả cơ chế ảo giác gốc của mô hình mẹ. Để điểm benchmark không bị xấu, các công ty phải đắp thêm các lớp lọc (Guardrails) dày đặc ở đầu ra.

==> Cơ chế ảo giác vẫn còn đó

Cơ chế ảo giác vẫn còn đó
Nhưng output ảo giác giảm
Thế thì đám frontier nó không chặn từ đầu cho bớt ảo giác đi, để con 5.6 nó ảo giác cao thế kia làm gì :oh:
Kiểu biết đối phương chép bài nên cố tình đánh lừa thằng nào chép không check lại à :oh:
 
Cơ chế ảo giác vẫn còn đó
Nhưng output ảo giác giảm
Thế thì đám frontier nó không chặn từ đầu cho bớt ảo giác đi, để con 5.6 nó ảo giác cao thế kia làm gì :oh:
Kiểu biết đối phương chép bài nên cố tình đánh lừa thằng nào chép không check lại à :oh:
Đó là Trade-off đánh đổi trong mô hình AI hiện nay, theo hướng Suy luận chuyên sâu hay theo hướng Chat bot thông thường

Nếu muốn điểm Benchmark ảo giác đẹp: Chỉ cần nhét 1 đống bộ Filter chặn 50% câu hỏi khó, chặn/lọc đầu ra vì mục tiêu chỉ là trả lời câu hỏi xã giao, tra cứu thông tin cơ bản.

Đám Frontier thì theo đuổi mô hình phải được tự do đưa ra các giả thuyết sai, thậm chí bịa ra các bước trung gian (ảo giác tạm thời) để tìm ra đáp án đúng cuối cùng. Nếu chặn họng ngay từ đầu, mô hình sẽ bị sợ sai, các bước suy luận bị gò bó và hoàn toàn mất khả năng giải các bài toán khó. Đám Frontier chấp nhận hallucination cao để đổi lấy Khả năng Suy luận Đột phá.

Đám Frontier cũng chơi đầu độc dữ liệu thôi nếu bọn nó biết Proxy/Bot này là đám dùng để Distill, cho nên anh chăm chăm distill, không đầu tư R&D để có bọn chuyên gia lọc dữ liệu hoặc tạo nguồn dữ liệu gốc thì không sớm thì muộn model của anh cũng bị đầu độc.
 
Sửa lần cuối:

Thống kê chủ đề

Ngày tạo
khelo,
Người trả lời cuối
SpaceXAI,
Trả lời
184
Lượt xem
19.667
Quay lại
Lên đầu trang