thắc mắc Cách lấy api hoặc crawl data của nhatot.com

  • Người tạo chủ đề Người tạo chủ đề yt.blue
  • Ngày bắt đầu Ngày bắt đầu

yt.blue

Junior Member
Như tiêu đề là em cần data của web nhatot.com.
Đầu tiên là về api em thử f12 tìm nhưng mà không thấy thì không biết nó có public api không tại vì em search thì trước đây có "https://gateway.chotot.com/v1/publi...cg=2010&w=1&limit=20&st=s&f=p"
Để lấy data thì vẫn có thể crawl về thì em xài selenium nhưng mà nó bắt không hết được element mà em muốn
1684175603090.png

ví dụ như thế này chỉ có các trường như title, m2, giá, xã phường hoặc huyện (https://www.nhatot.com/mua-ban-bat-dong-san-quan-binh-tan-tp-ho-chi-minh)
còn muốn chi tiết hơn phải click vô mới hiện được đầy đủ để bắt hết tất cả các trường mà em mong muốn thì không biết có cách nào có thể lấy mà không cần click vào không ạ
1684175759293.png

như này thì em có thêm các trường như giấy tờ, loại hình, hướng,...
 
Ko rõ cách API hoạt động thì xài selenium crawl luôn đi cho dễ, public page nên k dễ bị ban đâu

via theNEXTvoz for iPhone
 
Ko rõ cách API hoạt động thì xài selenium crawl luôn đi cho dễ, public page nên k dễ bị ban đâu

via theNEXTvoz for iPhone
Nhưng mà nó bị thiếu trường nếu em lấy data từ cái trang search thông tin, còn data đầy đủ phải click vô từng sản phảm bác ạ. Bác recommend cho em cách nào crawl data đầy đủ thông tin dudợc không ạ
 
Nhưng mà nó bị thiếu trường nếu em lấy data từ cái trang search thông tin, còn data đầy đủ phải click vô từng sản phảm bác ạ. Bác recommend cho em cách nào crawl data đầy đủ thông tin dudợc không ạ
headless chính là câu trả lời cho bẹn(cụ thể playwright, puppeteer)
 
Web bất động sản có nhiều trang dễ lấy mà lượng tin đăng nhiều hơn sao không dùng mà nhất định phải nhatot? VD 2 thằng batdongsan.com.vn, bds68.com.vn nhiều tin, muaban.net ít tin nhưng tỉ lệ chính chủ cao

Gửi từ Xiaomi M2007J3SG bằng vozFApp
 
Như tiêu đề là em cần data của web nhatot.com.
Đầu tiên là về api em thử f12 tìm nhưng mà không thấy thì không biết nó có public api không tại vì em search thì trước đây có "https://gateway.chotot.com/v1/public/ad-listing?region_v2=12000&cg=2010&w=1&limit=20&st=s&f=p"
Để lấy data thì vẫn có thể crawl về thì em xài selenium nhưng mà nó bắt không hết được element mà em muốn
Xem tệp đính kèm 1836415
ví dụ như thế này chỉ có các trường như title, m2, giá, xã phường hoặc huyện (https://www.nhatot.com/mua-ban-bat-dong-san-quan-binh-tan-tp-ho-chi-minh)
còn muốn chi tiết hơn phải click vô mới hiện được đầy đủ để bắt hết tất cả các trường mà em mong muốn thì không biết có cách nào có thể lấy mà không cần click vào không ạ
Xem tệp đính kèm 1836417
như này thì em có thêm các trường như giấy tờ, loại hình, hướng,...
Ví dụ như link bạn gửi thì get bằng link này "https://gateway.chotot.com/v2/publi...h/106331297.htm#px=SR-stickyad-[PO-2][PL-top]". Nhìn vào link kia so sánh với link "https://www.nhatot.com/mua-ban-bat-dong-san-quan-binh-tan-tp-ho-chi-minh", bạn thấy có thể cắt ghép được để ra link gateway kia được ngay.
 
Em có làm theo nhưng mà chỉ get được khoảng 20k record thì ko get được nữa mặc dù total hơn 100k, có cách nào để get thêm không ạ?
 
Nhưng mà nó bị thiếu trường nếu em lấy data từ cái trang search thông tin, còn data đầy đủ phải click vô từng sản phảm bác ạ. Bác recommend cho em cách nào crawl data đầy đủ thông tin dudợc không ạ
thì gọi từng trang chứ sao...
 

Thống kê chủ đề

Ngày tạo
yt.blue,
Người trả lời cuối
ColdBailey,
Trả lời
10
Lượt xem
5.340
Quay lại
Lên đầu trang