thắc mắc Mấy bác Data Engineer skill python có sử dụng pandas ?

  • Người tạo chủ đề Người tạo chủ đề nguyenluc900
  • Ngày bắt đầu Ngày bắt đầu
chào mấy bác,

Mình thắc mắc là mấy bác role data engineer khi xử lý dữ liệu dataset lớn thì xài thư viện pandas để xử lý hay không nhỉ ?
 
chào mấy bác,

Mình thắc mắc là mấy bác role data engineer khi xử lý dữ liệu dataset lớn thì xài thư viện pandas để xử lý hay không nhỉ ?
Có. Lưu ý là Pandas nó có một số practice nên theo để tối ưu. Dataset lớn thì chunk nó ra. Pandas ngon khi clean, có đủ đồ chơi. Nhưng aggregate thì không nhanh.

Combo Pandas + Numpy + Numba chơi tất. Tất nhiên là chưa nói đến vấn đề Infra nha.
 
Có. Lưu ý là Pandas nó có một số practice nên theo để tối ưu. Dataset lớn thì chunk nó ra. Pandas ngon khi clean, có đủ đồ chơi. Nhưng aggregate thì không nhanh.

Combo Pandas + Numpy + Numba chơi tất. Tất nhiên là chưa nói đến vấn đề Infra nha.
Bác có document ko để mình nghiên cứu.
 
Theo kinh nghiệm sử dụng mình thấy vài gb data thì spark ko hơn đc pandas, nhưng tầm chục đến vài chục gb là sẽ có sự khác biệt :D
Vài trăm cũng chưa thấm vào đâu đâu. Combo trên của mình cân 300GB vẫn chưa thấy vấn đề gì xảy ra.
 
cũng nghĩ là DE sẽ dùng java + apache ecosystem là chính, pandas kiểu nghịch lung tung thôi :d
 
Câu hỏi chưa cụ thể lắm nhỉ. Hơi chung chung.
Dùng thì có dùng chứ, nhưng dùng ở đâu, như nào và cho cái gì thôi.
Cty cũ mình thì data khá khủng nên production không chơi được mấy thể loại này cho mấy vài toán lớn. Bài toán nhỏ hơn xíu thì cut off và bắn xuống spark, nhỏ hơn nữa thì DS dùng dask.

Còn hiện tại mình vẫn dùng vì data không quá lớn, pandas vẫn vọc vạch được

via theNEXTvoz for iPhone
 
Câu hỏi chưa cụ thể lắm nhỉ. Hơi chung chung.
Dùng thì có dùng chứ, nhưng dùng ở đâu, như nào và cho cái gì thôi.
Cty cũ mình thì data khá khủng nên production không chơi được mấy thể loại này cho mấy vài toán lớn. Bài toán nhỏ hơn xíu thì cut off và bắn xuống spark, nhỏ hơn nữa thì DS dùng dask.

Còn hiện tại mình vẫn dùng vì data không quá lớn, pandas vẫn vọc vạch được

via theNEXTvoz for iPhone
Vậy trên production của ex-company bên bạn dùng stack gì vậy ?
 
Bên mình thì chủ yếu chơi trên aws nên ko phải lo gì mấy vụ setup gì hạ tầng ở dưới, cần thì khởi tạo resource, ko cần thì tắt đi, tập trung dev pipeline thôi :D Cơ mà bác Hellscream chơi đc 300 GB bằng Pandas thì cũng kinh, mình chưa gặp bh, bác có thể chia sẻ ae 1 chút là bác đang làm như tn ko :D
 
Bên mình thì chủ yếu chơi trên aws nên ko phải lo gì mấy vụ setup gì hạ tầng ở dưới, cần thì khởi tạo resource, ko cần thì tắt đi, tập trung dev pipeline thôi :D Cơ mà bác Hellscream chơi đc 300 GB bằng Pandas thì cũng kinh, mình chưa gặp bh, bác có thể chia sẻ ae 1 chút là bác đang làm như tn ko :D
Đã gọi là "không nói tới infra" thì nói gì nữa bạn ơi. Cắm đôi ba TB ram vào thì cân được chứ sao :D
Hic, nhìn mà thèm
đang vật lộn với mấy TB đã khốn khổ vì hạ tầng lởm khởm. Chỉ dám rón rén với pyspark
Ùi, giờ mình đang làm với vài GB đây. To thì cũng thích mà cũng mệt, mệt nhất ở khoản testing. Chạy con job mất cả tuần mới ra kết quả, sai đi sửa lại nhục lắm.

via theNEXTvoz for iPhone
 

Thống kê chủ đề

Ngày tạo
nguyenluc900,
Người trả lời cuối
southernstar,
Trả lời
36
Lượt xem
4.103
Quay lại
Lên đầu trang