thắc mắc Chọn loại database làm data warehouse?

  • Người tạo chủ đề Người tạo chủ đề childDE
  • Ngày bắt đầu Ngày bắt đầu

childDE

Junior Member
Em thắc mắc là data warehouse thường thiết kế để tối ưu tốc độ truy vấn lớn tạo report, vậy thì database nào là phù hợp được mn nhỉ? Em thấy clickhouse là một OLAP có tốc độ truy vấn đáng kinh ngạc, không biết liệu có thể sử dụng clickhouse làm data warehouse được không nhỉ?
 
+1. Mình SWE từng sử dụng clickhouse làm DB analytic, phải nói là tuyệt vời. Biết tận dụng materialized view của nó nữa thì build report là dễ
 
Anh em cho mình hỏi xíu,

đối với hệ thống chỉ cần search liên tục, gần như 99% là dành cho search và yêu cầu phải search thật nhanh, data chỉ nằm trên 1 cột duy nhất nhưng lên đến hàng chục tỷ records

ngoài việc index tốt, mình nên dùng ClickHouse này hay nên triển khai ELK nhỉ, mình không phải dev nên không rành lắm nhờ anh em tư vấn giúp
 
Anh em cho mình hỏi xíu,

đối với hệ thống chỉ cần search liên tục, gần như 99% là dành cho search và yêu cầu phải search thật nhanh, data chỉ nằm trên 1 cột duy nhất nhưng lên đến hàng chục tỷ records

ngoài việc index tốt, mình nên dùng ClickHouse này hay nên triển khai ELK nhỉ, mình không phải dev nên không rành lắm nhờ anh em tư vấn giúp
Data type là gì sếp

via theNEXTvoz for iPhone
 
Anh em cho mình hỏi xíu,

đối với hệ thống chỉ cần search liên tục, gần như 99% là dành cho search và yêu cầu phải search thật nhanh, data chỉ nằm trên 1 cột duy nhất nhưng lên đến hàng chục tỷ records

ngoài việc index tốt, mình nên dùng ClickHouse này hay nên triển khai ELK nhỉ, mình không phải dev nên không rành lắm nhờ anh em tư vấn giúp
partition nó ra, chứ tối ưu hiệu năng mà chỉ dựa vào tech stack ko thôi thì kiểu gì chả tới giới hạn
 
Anh em cho mình hỏi xíu,

đối với hệ thống chỉ cần search liên tục, gần như 99% là dành cho search và yêu cầu phải search thật nhanh, data chỉ nằm trên 1 cột duy nhất nhưng lên đến hàng chục tỷ records

ngoài việc index tốt, mình nên dùng ClickHouse này hay nên triển khai ELK nhỉ, mình không phải dev nên không rành lắm nhờ anh em tư vấn giúp

ClickHouse dùng cho real time analytics còn nếu 99% search thì ELK thẳng tiến.



via theNEXTvoz for iPhone
 
e đang lấy external data ném vào s3, enrich + transform, sau đó write batch vào DB, data text, e đang chưa biết chọn DB nào, e đang nghiêng về postgre + rds do cần query phức tạp

giờ e muốn tối ưu chi phí cho analysis/ML thì nên dùng warehouse truyền thống hay delta lake ạ

via theNEXTvoz for iPhone
 
Sửa lần cuối:
Bên mình lưu dữ liệu dạng parquet trên hdfs.
Lakehouse đang dùng Iceberg làm table format, Hive làm Catalog vs Dremio/Spark để query Iceberg table (tất cả đang dùng open source hết)
Cái Iceberg nó ngon ở chỗ là hỗ trợ Update/Delete như RDBMS bình thường luôn, chứ ngày xưa dùng Hive nó k cho Update vs Delete, toàn phải Insert Overwrite
 
e cảm ơn ạ, sách hay quá bác, đọc xong đúng vỡ ra nhiều cái thật, e vừa propose phương án cho cấp trên xong :)

via theNEXTvoz for iPhone
You are welcome, chỉ có tự nghiên cứu, nghiền ngẫm, hiểu trade off rồi apply tình hình thực tế mới giải quyết đc thôi chứ đem lên đây đâu ai biết tình huống của bác là gì đâu :D
 
Anh em cho mình hỏi xíu,

đối với hệ thống chỉ cần search liên tục, gần như 99% là dành cho search và yêu cầu phải search thật nhanh, data chỉ nằm trên 1 cột duy nhất nhưng lên đến hàng chục tỷ records

ngoài việc index tốt, mình nên dùng ClickHouse này hay nên triển khai ELK nhỉ, mình không phải dev nên không rành lắm nhờ anh em tư vấn giúp
Elasticsearch thôi. Nhưng hàng tỷ record thì elasticsearch cluster phải lớn lắm mới gánh nổi yêu cầu search nhanh.

Bắt đầu với 3 data node. Mỗi data node 64GB, heap 31gb (< 32gb). Chậm thì thêm data node vào.

3 Masternode càng ổn định càng tốt.

Còn phải tối ưu sharding nữa (20gb-50gb một shard). Mà tổng số shard phụ thuộc vào heap và node*CPU core nữa.

Nói chung điều chỉnh từ từ đến khi nào OK thì thôi.
 
Sửa lần cuối:

Thống kê chủ đề

Ngày tạo
childDE,
Người trả lời cuối
NancyJewelMcDonie,
Trả lời
23
Lượt xem
4.529
Quay lại
Lên đầu trang