thắc mắc Crawl data web truyện tranh

  • Người tạo chủ đề Người tạo chủ đề linhlinhcuctran
  • Ngày bắt đầu Ngày bắt đầu

linhlinhcuctran

Junior Member
Chào các bác, em đang muốn làm một website truyện tranh, các bác cho em hỏi một số ý sau ạ:
1. Có tool crawl nào ngon, rẻ không, hay phải tự code (em code được nodejs)
2. Nguồn truyện ở đâu hợp lý và có vấn đề gì về bản quyền không
 
Nếu code đc thì tự code cho nhanh thím. Quan trọng kiếm nguồn trang thôi. Đã crawl rồi thì bản quyền gì nữa @@
 
Chào các bác, em đang muốn làm một website truyện tranh, các bác cho em hỏi một số ý sau ạ:
1. Có tool crawl nào ngon, rẻ không, hay phải tự code (em code được nodejs)
2. Nguồn truyện ở đâu hợp lý và có vấn đề gì về bản quyền không
1. Thường thì mỗi website khác nhau thì sẽ viết script khác nhau chứ k có chung được, khả năng là tự code, Nodejs thì có thể dùng cheerio hoặc mấy cái browser headless như puppeteer, selenium...
2. Em thấy mấy trang manga nó toàn đi crawl của nhau thôi thím khỏi lo :v
 
Chào các bác, em đang muốn làm một website truyện tranh, các bác cho em hỏi một số ý sau ạ:
1. Có tool crawl nào ngon, rẻ không, hay phải tự code (em code được nodejs)
2. Nguồn truyện ở đâu hợp lý và có vấn đề gì về bản quyền không
1. Selenium đi thím khá dễ tiếp cận.
2.Thím đã đi crawl rồi mà lại tính đến bản quyền @@, nếu thím quan tâm đến bản quyền thì bên đó sẽ đưa hẳn chap cho bác luôn. =)) mong bác đừng là nettruyen thứ 2 :V
 
mình thấy trên mạng cũng có source cào đó bác, nhưng mà tự làm cũng không mất nhiều thời gian lắm đâu
về crawl thì nhớ để delay nhé bác, vì e nghe bảo đây là "luật" của các team sub (1 cách để tránh web mất traffic)
còn bản quyền thì kệ đi bác :embarrassed:, các team sub 1 là lượm 2 là có contract riêng với tác giả, qua tay mình crawl thì khỏi quan tâm chi
 
chào các bác, sau một thời gian mò, e đang gặp một số vấn đề cần các bác tư vấn tiếp ạ
  • khi crawl nhiều nguồn thì làm sao lọc trùng lặp giữa các nguồn, ví dụ cùng một truyện nhưng link và title đôi khi không giống nhau
  • e thấy lượng data crawl về khá lớn khoảng trên 50gb thì có cần chọn lọc truyện cho bớt nhiều không ạ
  • nếu database lớn vậy thì có cách nào tối ưu chi phí thuê VPS ko, ví dụ tách ra database cloud
 
chào các bác, sau một thời gian mò, e đang gặp một số vấn đề cần các bác tư vấn tiếp ạ
  • khi crawl nhiều nguồn thì làm sao lọc trùng lặp giữa các nguồn, ví dụ cùng một truyện nhưng link và title đôi khi không giống nhau
  • e thấy lượng data crawl về khá lớn khoảng trên 50gb thì có cần chọn lọc truyện cho bớt nhiều không ạ
  • nếu database lớn vậy thì có cách nào tối ưu chi phí thuê VPS ko, ví dụ tách ra database cloud
hỏi ngu cái là truyện tranh thì cái crawl về là file hình nhỉ? nếu vậy thì lưu tất cả ảnh vô storage, rồi DB chỉ lưu link của ảnh => chi phí nằm ở storage chứ đâu phải DB mà đi tách DB nhỉ?
 
chào các bác, sau một thời gian mò, e đang gặp một số vấn đề cần các bác tư vấn tiếp ạ
  • khi crawl nhiều nguồn thì làm sao lọc trùng lặp giữa các nguồn, ví dụ cùng một truyện nhưng link và title đôi khi không giống nhau
  • e thấy lượng data crawl về khá lớn khoảng trên 50gb thì có cần chọn lọc truyện cho bớt nhiều không ạ
  • nếu database lớn vậy thì có cách nào tối ưu chi phí thuê VPS ko, ví dụ tách ra database cloud
Lưu link file thôi thím chứ lưu file vào database làm j
 
chào các bác, sau một thời gian mò, e đang gặp một số vấn đề cần các bác tư vấn tiếp ạ
  • khi crawl nhiều nguồn thì làm sao lọc trùng lặp giữa các nguồn, ví dụ cùng một truyện nhưng link và title đôi khi không giống nhau
  • e thấy lượng data crawl về khá lớn khoảng trên 50gb thì có cần chọn lọc truyện cho bớt nhiều không ạ
  • nếu database lớn vậy thì có cách nào tối ưu chi phí thuê VPS ko, ví dụ tách ra database cloud
Như mấy thím trên nói thì thím cũng chỉ lên crawl ảnh rồi upload lên Cloud storage hay S3 còn db lưu link sau khi upload thôi
 
nếu users vn nên xài vps vn (free băng thông), chứ xài mấy thằng như aws chết tiền bandwidth
 
hỏi ngu cái là truyện tranh thì cái crawl về là file hình nhỉ? nếu vậy thì lưu tất cả ảnh vô storage, rồi DB chỉ lưu link của ảnh => chi phí nằm ở storage chứ đâu phải DB mà đi tách DB nhỉ?
Lưu link file thôi thím chứ lưu file vào database làm j
Như mấy thím trên nói thì thím cũng chỉ lên crawl ảnh rồi upload lên Cloud storage hay S3 còn db lưu link sau khi upload thôi
à sorry các thím, em mới chuyển hướng sang truyện chữ rồi :)
 
Mình không biết có liên quan không nhưng bạn thử tham khảo thêm Tachiyomi nhé. Họ kéo ảnh về từ rất nhiều nguồn, ta có, tây có :big_smile:
 

Thống kê chủ đề

Ngày tạo
linhlinhcuctran,
Người trả lời cuối
demonhuter90,
Trả lời
19
Lượt xem
8.099
Quay lại
Lên đầu trang