[HCM] Tài chính quanh 100++ triệu xin tư vấn case chủ yếu về build cấu hình AI tầm trung

niềm vui nho nhỏ

Senior Member
Chào mọi người,

Hiện công ty đang có nhu cầu xây dựng một hệ thống AI local quy mô nhỏ, tập trung vào hai tác vụ chính:

1. Chuyển đổi PDF sang Markdown (dùng model MinerU)
2. Chatbot hỗ trợ xử lý số liệu đơn giản cho các phòng kế toán

Em rất mong mọi người tư vấn, góp ý giúp em về hướng triển khai. Cảm ơn mọi người ạ!
 
Chào mọi người,

Hiện công ty đang có nhu cầu xây dựng một hệ thống AI local quy mô nhỏ, tập trung vào hai tác vụ chính:

1. Chuyển đổi PDF sang Markdown (dùng model MinerU)
2. Chatbot hỗ trợ xử lý số liệu đơn giản cho các phòng kế toán

Em rất mong mọi người tư vấn, góp ý giúp em về hướng triển khai. Cảm ơn mọi người ạ!
Dạ em chào anh ạ! Cho em hỏi là công ty mình đang muốn làm theo kiểu máy chủ hay là làm theo kiểu đơn giản (Như không làm rack mà chỉ là bộ PC thường được bảo quản ở phòng nào đó ạ) do là chạy AI local thì yêu cầu GPU với CPU mạnh nên mình cũng phải tính đến phương án làm mát hệ thống nữa ạ.

Và mình nên tìm công ty xây dựng máy chủ uy tín nữa ạ nếu mình theo hướng xây theo kiểu máy chủ ạ, có bảo hành và trách nhiệm nữa thì được luôn ạ :)
 
Dạ em chào anh ạ! Cho em hỏi là công ty mình đang muốn làm theo kiểu máy chủ hay là làm theo kiểu đơn giản (Như không làm rack mà chỉ là bộ PC thường được bảo quản ở phòng nào đó ạ) do là chạy AI local thì yêu cầu GPU với CPU mạnh nên mình cũng phải tính đến phương án làm mát hệ thống nữa ạ.
dạ hiện tại em chỉ mới nhận được về mức budget nên cần tư vấn của mọi người ạ. Anh có thể tư vấn thêm giúp em về những option đó ạ.
 
dạ hiện tại em chỉ mới nhận được về mức budget nên cần tư vấn của mọi người ạ. Anh có thể tư vấn thêm giúp em về những option đó ạ.
Tiếc là em không thể xây dựng được ạ nhưng mà kệ đi, em sẽ cố gắng hỗ trợ cho anh trong việc dựng lên cấu hình cơ bản trước nha anh!

Rồi, do anh có nhu cầu là chạy model AI local thì em cũng phải hỏi thêm là model AI của mình có nặng không ạ? Nếu mà mình lấy bên nào thì nhờ anh chia sẻ luôn ạ để em xem là cần bao nhiêu GPU loại gì để chạy được ạ cùng với những đồ khác nữa ạ. CPU thì em nghĩ mình có thể lấy dòng AMD EPYC 9004, RAM DDR5 128 GB có ECC, mainboard thì mình chọn MZ23 của GIGABYTE ạ.

Về cơ bản là vậy ạ còn về phần hệ thống làm mát thì để em nghiên cứu thêm ạ chứ để đánh nhau với CPU EPYC này thì cũng khó ạ :eek:
 
Tiếc là em không thể xây dựng được ạ nhưng mà kệ đi, em sẽ cố gắng hỗ trợ cho anh trong việc dựng lên cấu hình cơ bản trước nha anh!

Rồi, do anh có nhu cầu là chạy model AI local thì em cũng phải hỏi thêm là model AI của mình có nặng không ạ? Nếu mà mình lấy bên nào thì nhờ anh chia sẻ luôn ạ để em xem là cần bao nhiêu GPU loại gì để chạy được ạ cùng với những đồ khác nữa ạ. CPU thì em nghĩ mình có thể lấy dòng AMD EPYC 9004, RAM DDR5 128 GB có ECC, mainboard thì mình chọn MZ23 của GIGABYTE ạ.

Về cơ bản là vậy ạ còn về phần hệ thống làm mát thì để em nghiên cứu thêm ạ chứ để đánh nhau với CPU EPYC này thì cũng khó ạ :eek:
Cảm ơn bạn nhan,

Model: bên mình chạy 2 workload.
(1) MinerU — pipeline bóc tách PDF, model đi kèm nhẹ (~3–4GB VRAM) nhưng BẮT BUỘC chạy CUDA/NVIDIA.
(2) Chatbot nội bộ dùng Qwen3-30B-A3B, tải open-weights từ Hugging Face, bản AWQ 4-bit ~18GB VRAM, serve bằng vLLM cho nhiều người dùng đồng thời. Định hướng 2–3 năm có thể lên lớp model 70–120B (MoE).
 
1784709934368.webp
1784709949269.webp



Này là cấu hình em tự research mọi người có thể tham khảo và cho thêm góp ý ạ
 
Cảm ơn bạn nhan,

Model: bên mình chạy 2 workload.
(1) MinerU — pipeline bóc tách PDF, model đi kèm nhẹ (~3–4GB VRAM) nhưng BẮT BUỘC chạy CUDA/NVIDIA.
(2) Chatbot nội bộ dùng Qwen3-30B-A3B, tải open-weights từ Hugging Face, bản AWQ 4-bit ~18GB VRAM, serve bằng vLLM cho nhiều người dùng đồng thời. Định hướng 2–3 năm có thể lên lớp model 70–120B (MoE).
Dạ em cảm ơn thông tin của anh ạ! Vậy thì nếu mình chạy model của QWen là Chatbot và model MinerU thì em có hai định hướng cho mình mà em thấy có khả năng nhất ạ! Nó thực chất là một chính và hai nhánh thôi ạ :D

Một dàn PC chạy cho model MinerU thì mình CPU I5-12600K hoặc là Ryzen 5 5600, RAM 32 GB DDR5, GPU RTX 5090, main B650M hoặc B860 của GIGABYTE và bộ nguồn tầm 850 đến 900W của bên Seasonic hoặc là của GIGABYTE là được ạ!

Dành cho model Qwen thì em có chia ra hai hướng, mình chơi theo kiểu Queue System (Nghĩa là hệ thống hàng chờ, xử lý từng người) thì mình cũng lấy cấu hình ở trên luôn ạ nhưng về phần GPU thì mình sẽ dùng hai bé RTX 5090, tản AIO cho CPU và 64 GB RAM DDR5.

Mình có thêm một cách khác đó là chạy container dùng Docker hoặc Podman, nghĩa là có một người gọi thì máy sẽ tự khởi chạy một container, load model vào rồi phản hồi lại và sau một thời gian không sử dụng thì container sẽ tự tắt để nhường tài nguyên khác hoặc tái sử dụng lại. Nếu mình đi theo hướng này thì mình sẽ nâng cấp CPU lên Ryzen 7700X và giữ lại đồ cho phần Queue System ạ!

UPDATE: À, giờ em mới nhận ra là em quên mất cái phần bộ nhớ ạ :? Về máy chạy MinerU thì anh cho nó SSD 128 GB dành riêng cho nó chạy model với hệ điều hành và cỡ 500 GB đến 1 TB cho máy chạy Chatbot chính. Em quên, xin lỗi anh 9 :D
 
Sửa lần cuối:
Em xin lỗi anh nếu cái này hơi khó hiểu, em cố phân ra rồi mà em không biết phân sao cho nó hợp lý ạ nên mình ráng nha anh!

Rồi, em sẽ chỉ đèn qua phần model mình dùng nha anh. Nếu anh muốn tiết kiệm tài nguyên thì thay vì anh chạy bản base thì mình có thể dùng bản Quantization hoặc là bản đã được xử lý lại ạ, bản này thì nó sẽ nhẹ hơn về tài nguyên nhưng sẽ có hi sinh về độ thông minh của nó khi mình càng tiết kiệm ạ, em giới thiệu cho anh hai người làm cái này tốt là bartowskimradermacher. Model nó sẽ nhẹ hẳn tùy vào thuật toán mà anh chọn ạ nên khi anh chọn thì anh nhìn vào cái Quant Type và Description để hiểu thêm, đọc thêm về Quantization nếu anh chưa biết ạ.
 
Em xin lỗi anh nếu cái này hơi khó hiểu, em cố phân ra rồi mà em không biết phân sao cho nó hợp lý ạ nên mình ráng nha anh!

Rồi, em sẽ chỉ đèn qua phần model mình dùng nha anh. Nếu anh muốn tiết kiệm tài nguyên thì thay vì anh chạy bản base thì mình có thể dùng bản Quantization hoặc là bản đã được xử lý lại ạ, bản này thì nó sẽ nhẹ hơn về tài nguyên nhưng sẽ có hi sinh về độ thông minh của nó khi mình càng tiết kiệm ạ, em giới thiệu cho anh hai người làm cái này tốt là bartowskimradermacher. Model nó sẽ nhẹ hẳn tùy vào thuật toán mà anh chọn ạ nên khi anh chọn thì anh nhìn vào cái Quant Type và Description để hiểu thêm, đọc thêm về Quantization nếu anh chưa biết ạ.

thanks bạn nhé.

1) Bên mình dùng bản quantized ngay từ spec rồi — "Qwen3-30B-A3B AWQ 4-bit ~18GB" . Bản base BF16 nặng ~61GB, không vừa card 32GB nào huhu

2) bartowski và mradermacher làm định dạng GGUF — dành cho llama.cpp/Ollama. Stack chatbot của mình tính là vLLM (để phục vụ nhiều người đồng thời bằng continuous batching), mà vLLM không chạy GGUF ở mức production. (Qwen có phát hành quant chính chủ trên Hugging Face nên mình đang xem xét dùng bản đó lun)


p/s: với lại cái khó ngân sách mình tầm quanh 100 triệu thôi sợ cấu hình của bạn bên mình hem đáp ứng nỗi
 
thanks bạn nhé.

1) Bên mình dùng bản quantized ngay từ spec rồi — "Qwen3-30B-A3B AWQ 4-bit ~18GB" . Bản base BF16 nặng ~61GB, không vừa card 32GB nào huhu

2) bartowski và mradermacher làm định dạng GGUF — dành cho llama.cpp/Ollama. Stack chatbot của mình tính là vLLM (để phục vụ nhiều người đồng thời bằng continuous batching), mà vLLM không chạy GGUF ở mức production. (Qwen có phát hành quant chính chủ trên Hugging Face nên mình đang xem xét dùng bản đó lun)


p/s: với lại cái khó ngân sách mình tầm quanh 100 triệu thôi sợ cấu hình của bạn bên mình hem đáp ứng nỗi
Umm thì đó mới là vấn đề ạ do là vản Base nặng thật, em mà cho anh hai GPU H100 là lúc đó là vượt quá kinh phí liền anh ạ do nên là cũng khó anh ạ...

Vậy thì mình dùng kế sách khác anh ạ! Vậy thì máy chạy MinerU cho về card đời cũ như là RTX 3060 và 16 GB RAM DDR4 (2x8GB), em nghĩ chạy OCR thì cũng nhẹ ạ. Về phần máy chạy model thì mình có hai phương án là giảm đời xuống thành 3090 hoặc là chuyển sang dùng card AMD cho VRAM nhiều hơn khi chạy dual GPU ạ do em hết phương án mất rồi ạ ._.

Ngoài ra thì RAM của máy chạy model thì có thể xuống luôn như máy chạy MinerU nhưng em sợ là nó bị tràn RAM rồi sập mất ạ nhưng mình cứ cho nó xuống đi ạ vào gồm cả bộ nhớ nữa.

Nhờ anh xem phương án này xem thế nào ạ, em chém xuống nhiều nhất có thể rồi :eek:
 
Umm thì đó mới là vấn đề ạ do là vản Base nặng thật, em mà cho anh hai GPU H100 là lúc đó là vượt quá kinh phí liền anh ạ do nên là cũng khó anh ạ...

Vậy thì mình dùng kế sách khác anh ạ! Vậy thì máy chạy MinerU cho về card đời cũ như là RTX 3060 và 16 GB RAM DDR4 (2x8GB), em nghĩ chạy OCR thì cũng nhẹ ạ. Về phần máy chạy model thì mình có hai phương án là giảm đời xuống thành 3090 hoặc là chuyển sang dùng card AMD cho VRAM nhiều hơn khi chạy dual GPU ạ do em hết phương án mất rồi ạ ._.

Ngoài ra thì RAM của máy chạy model thì có thể xuống luôn như máy chạy MinerU nhưng em sợ là nó bị tràn RAM rồi sập mất ạ nhưng mình cứ cho nó xuống đi ạ vào gồm cả bộ nhớ nữa.

Nhờ anh xem phương án này xem thế nào ạ, em chém xuống nhiều nhất có thể rồi :eek:
cho em xin báo giá cụ thể của mình thử ạ
 
cho em xin báo giá cụ thể của mình thử ạ
Dạ tiếc là em không phải là người trong ngành ạ nên em cũng khó báo giá cho anh được ạ, mình thử hỏi mấy anh ở bên đây thử xem anh hoặc nhờ mấy cửa hàng build PC tư vấn xem thế nào anh! Em thì chỉ có thể hỗ trợ xây dựng cấu hình cơ bản với phương án để xem trước được thôi, mọi sự chuyên nghiệp giao cho các cửa hàng uy tín ạ :)
 
Chào mọi người,

Hiện công ty đang có nhu cầu xây dựng một hệ thống AI local quy mô nhỏ, tập trung vào hai tác vụ chính:

1. Chuyển đổi PDF sang Markdown (dùng model MinerU)
2. Chatbot hỗ trợ xử lý số liệu đơn giản cho các phòng kế toán

Em rất mong mọi người tư vấn, góp ý giúp em về hướng triển khai. Cảm ơn mọi người ạ!
1784910190513.webp

Ngân sách này mà model 30B thì bác có con này dùng được

GIGABYTE AI TOP ATOM

Bản 4TB tầm 122tr thui​

 
tầm 120tr đổ lại thì khả năng k rớ dc r :( riêng tiền ram cho nhẹ nhàng 64gb D5 cũng trên 15tr nếu Intel và trên 17tr nếu AMD. main cpu vừa phải tầm 10tr/ NVME 1TB samsung phải chọn những con dòng Pro là bắt buộc k dc lựa chọn khác vì TBW quá thấp. xịn sò cũng gần top như 990evo-990evo plus mà cũng lẹt đẹt vài TBW nên dòng Pro 1TB cũng trên 6tr+ cục nguồn/case và tản nhiệt 4-5tr. và phần còn lại là nhân vật chính con card não của đám AI. 80tr k thể mua 5090 32gb :( nên lựa chọn lại 4090
 

Thống kê chủ đề

Ngày tạo
niềm vui nho nhỏ,
Người trả lời cuối
niềm vui nho nhỏ,
Trả lời
17
Lượt xem
2.494
Quay lại
Lên đầu trang