Có nên chọn theo Data Engineer không

  • Người tạo chủ đề Người tạo chủ đề ngarecuocdoi_09
  • Ngày bắt đầu Ngày bắt đầu
bác học trường gì thế, với lại đã có những kiến thức cơ bản nào về data engineer rồi ạ?
em học BKHN. Hồi trước có làm quen với các công nghệ như Hadoop, Spark qua btl nhưng chưa sâu. Airlfow và Elasticsearch thì có cơ hội làm qua ở công ty đang thực tập. Chủ yếu ở công ty viết API với fix các luồng thu thập dữ liệu thôi bác ạ.
 
Ở đây có bác nào làm DBA không, em thấy DE với DBA nhiều cái liên quan đến nhau
 
Hi. Mình thấy làm DE có 2 mảng chính, sẽ lấy ví dụ cụ thể ở công ty hiện giờ luôn
1. Data ETL
  • Thiết kế datawarehouse (kimball)
  • Xây dựng luồng xử lý dữ liệu theo thiết kế dwh (pyspark, dbt-trino)
  • Ingest dữ liệu thô (spark, polars, debezium)
  • Lập lịch (Airflow)
2. Data Platform
  • Thiết kế và quản trị hệ thống data (k8s), thường gồm các phần chính:
    • storage: hdfs, s3, postgresql, clickhouse
    • compute: spark, jupyter
    • serving: query engine (trino), message queue (kafka), metadata (datahub), visualization (superset), logs/metric (grafana)
  • Nghiên cứu để tối ưu hệ thống, giải quyết tech debts, đề xuất công nghệ mới, giả sử starrocks vs trino, dagster vs airflow, table format (deltalake, iceberg), openmetadata vs datahub
  • Phát triển tools phù hợp yêu cầu của công ty
  • Data Engineer = Software Engineer for Data
 
Sửa lần cuối:
Hi. Mình thấy làm DE có 2 mảng chính, sẽ lấy ví dụ cụ thể ở công ty hiện giờ luôn
1. Data ETL
  • Thiết kế datawarehouse (kimball)
  • Xây dựng luồng xử lý dữ liệu theo thiết kế dwh (pyspark, dbt-trino)
  • Ingest dữ liệu thô (spark, polars, debezium)
  • Lập lịch (Airflow)
2. Data Platform
  • Thiết kế và quản trị hệ thống data (k8s), thường gồm các phần chính:
    • storage: hdfs, s3, postgresql, clickhouse
    • compute: spark, jupyter
    • serving: query engine (trino), message queue (kafka), metadata (datahub), visualization (superset), logs/metric (grafana)
  • Nghiên cứu để tối ưu hệ thống, giải quyết tech debts, đề xuất công nghệ mới, giả sử starrocks vs trino, dagster vs airflow, table format (deltalake, iceberg), openmetadata vs datahub
  • Phát triển tools phù hợp yêu cầu của công ty
  • Data Engineer = Software Engineer for Data
Nếu outsource thì thường theo hướng nào và product thì theo hướng nào vậy bác?
 
Em chào các tiền bối ạ.
Em thấy có quả job ở viettel như này:

Mô Tả Công Việc
  • Tham gia xây dựng các hệ thống xử lý BigData cho toàn bộ mạng viễn thông.
  • Tham gia xây dựng các hệ thống lớn xử lý được hàng triệu yêu cầu một giây, sử dụng các công nghệ, kiến trúc mới nhất.
  • Tham gia xây dựng các giao thức điều khiển cho thiết bị mạng hoạt động trên mạng lưới.
  • Xây dựng các service phục vụ việc kết nối giữa các thành phần của hệ thống.

Yêu cầu bắt buộc
  1. Thành thạo một trong các ngôn ngữ C/C++/Golang.
  2. Thành thạo ngôn ngữ SQL là lợi thế.
  3. Thành thạo Kafka, Hadoop là một lợi thế.
  4. Có khả năng tối ưu code, tìm lỗi và xử lý lỗi.
  5. Có kiến thức về cấu trúc dữ liệu và giải thuật.
  6. Có kiến thức về các kiến trúc phần mềm.
Không biết đây có phải jd cho title DE không ạ? Bản thân em làm lập trình nhúng C++, đang muốn nhảy qua mảng khác thử xem thế nào, thấy jd này trông thú vị quá mà không biết cách tiếp cận thế nào cho hiệu quả với đống yêu cầu bắt buộc kia(Đặc biệt là mục 2 và 3 =(() Rất mong các ae cho em xin chút lời khuyên, em cũng level junior đi làm được hơn năm thôi ạ :D
 
Sửa lần cuối:

Thống kê chủ đề

Ngày tạo
ngarecuocdoi_09,
Người trả lời cuối
dark_knight09,
Trả lời
28
Lượt xem
11.785
Quay lại
Lên đầu trang