thắc mắc Mấy bác Data Engineer skill python có sử dụng pandas ?

  • Người tạo chủ đề Người tạo chủ đề nguyenluc900
  • Ngày bắt đầu Ngày bắt đầu
Tiện hỏi các bác có cách nào dùng pandas đọc file Excel XLSX nhanh không? Tốc độ đọc chậm quá.
 
Cái này mình cũng hỏi trên StackOverFlow rồi nhưng chưa thấy ai có giải pháp nào để tăng tốc cả.
Vì một số lý do bắt buộc phải lưu dạng xlsx.
 
Cái này mình cũng hỏi trên StackOverFlow rồi nhưng chưa thấy ai có giải pháp nào để tăng tốc cả.
Vì một số lý do bắt buộc phải lưu dạng xlsx.
Tóm lại là anh hỏi trên voz này cũng để cho vui thôi đúng không? Vì thật ra anh cũng đâu cần câu trả lời :go:

Edit: Thôi thì tôi cũng chả dỗi anh nữa. Cách tôi read excel vào pandas như sau:
  • Dùng xlsx2csv convert excel qua csv chạy multiprocessing (IO-bound)
  • Dùng read_csv để read đống csv sau khi convert.
Cái này bọn tôi wrap nó thành 1 cái utils nhỏ nhỏ để dùng chung.
 
Sửa lần cuối:
Tóm lại là anh hỏi trên voz này cũng để cho vui thôi đúng không? Vì thật ra anh cũng đâu cần câu trả lời :go:

Edit: Thôi thì tôi cũng chả dỗi anh nữa. Cách tôi read excel vào pandas như sau:
  • Dùng xlsx2csv convert excel qua csv chạy multiprocessing (IO-bound)
  • Dùng read_csv để read đống csv sau khi convert.
Cái này bọn tôi wrap nó thành 1 cái utils nhỏ nhỏ để dùng chung.
Anh bị dở à. Tôi hỏi trên đó không có trả lời, tôi thấy thớt này thì tôi hỏi xem biết đâu có ai biết.
Thank anh giới thiệu cái lib, để tôi thử.
 
Anh bị dở à. Tôi hỏi trên đó không có trả lời, tôi thấy thớt này thì tôi hỏi xem biết đâu có ai biết.
Thank anh giới thiệu cái lib, để tôi thử.
1. Tôi không bị dở.
2. Anh nói anh hỏi trên stackoverflow nhưng không vất nổi 1 cái link ra để người ta biết anh đã hỏi cái gì.
Tôi cười với cách đi hỏi của anh.
 
1. Tôi không bị dở.
2. Anh nói anh hỏi trên stackoverflow nhưng không vất nổi 1 cái link ra để người ta biết anh đã hỏi cái gì.
Tôi cười với cách đi hỏi của anh.
Mình đang build Data Warehouse, stack mình đang xài là: C#( Làm Web services), Python, SSIS.
Một số task đơn giản get data từ source SQL thì mình xài SSIS, còn lại mình code bằng Python.
Hiện tại mình đang dùng Windows Task để schedule các script của Python. (Có nhiều hạn chế)
Ko biết là mấy anh DE thường dùng cái gì để schedule script python nhỉ ?
 
Mình đang build Data Warehouse, stack mình đang xài là: C#( Làm Web services), Python, SSIS.
Một số task đơn giản get data từ source SQL thì mình xài SSIS, còn lại mình code bằng Python.
Hiện tại mình đang dùng Windows Task để schedule các script của Python. (Có nhiều hạn chế)
Ko biết là mấy anh DE thường dùng cái gì để schedule script python nhỉ ?
Bác có thể dùng airflow nha.
https://airflow.apache.org/.
Ở đấy ngoài có pythonOperator thì còn BashOperator, Senor, HDFSSensor...
 
Mình đang build Data Warehouse, stack mình đang xài là: C#( Làm Web services), Python, SSIS.
Một số task đơn giản get data từ source SQL thì mình xài SSIS, còn lại mình code bằng Python.
Hiện tại mình đang dùng Windows Task để schedule các script của Python. (Có nhiều hạn chế)
Ko biết là mấy anh DE thường dùng cái gì để schedule script python nhỉ ?
Thím có thể ngó qua Airflow và Luigi.
Nhưng con DW thím đang build thì mình đoán là xoay quanh SQL Server: ssrs, ssas, ssis ... nên cứ chơi bộ tool của ms cho tiện.
Còn không bác tách mấy con orchestration ra thành hệ thống riêng cũng được.
Bên mình trước cũng có con dw dựng với sql server, phần etl thì mình tách riêng còn từ atomic đi thì nằm trong MS-eco system

via theNEXTvoz for iPhone
 
Ko biết là mấy anh DE thường dùng cái gì để schedule script python nhỉ ?

Bác có thể dùng airflow nha.
https://airflow.apache.org/.
Ở đấy ngoài có pythonOperator thì còn BashOperator, Senor, HDFSSensor...
Mình cũng đang dùng airflow nhung nhiều cái khó setup rẽ nhánh nên chuyển sang tự code một cái base trên celery :LOL:

Về sau tìm hiểu thêm được thằng này: prefect.io.
 
mở xlsx mình dùng openpyxl

search trên mạng thấy nên dùng. chưa dùng cái khác nên ko b so sánh

trả lời câu hỏi cũa chủ thớt là có nhé
panda và numpy
 
Nhưng thật ra pyspark cũng cấp DataFrame cũng khá giống df của pandas (khác nhau cũng kha khá), hiểu tư tưởng từ df thì sang pyspark dễ không thôi. Còn DE thì như chỗ t làm trước họ không dùng mấy. Đa phần viết job ETL với các con db cho search+index th
 

Thống kê chủ đề

Ngày tạo
nguyenluc900,
Người trả lời cuối
southernstar,
Trả lời
36
Lượt xem
4.103
Quay lại
Lên đầu trang