Cái này em chưa nghĩ ra reply như thế nào

Để em thử suy nghĩ thêm xem sao ạ.
Có thể dùng AWS Glue Crawler, AWS Glue Catalog để tạo catalog các tables trên lake. Sau đó user có thể dùng Athena query. Như một bên cũ của em là cho user query bằng dbeaver để thân thiện với user. User có thể lựa chọn query/kéo về local nếu cần để làm các báo cáo chuyên sâu hơn.
Cái này thú thực em chưa có kinh nghiệm, cần phải tìm hiểu thêm về cái này.
Em thử đếm cua trong lỗ thì như sau:
2Gb/day ~ 1.5 records/second & 100kb/record
Giá cho khoảng 2Gb/ngày ~ 70Gb/month 2 days retention region Singapore
Em tính thử on-demand và cả provisioned thì giao động khoảng 45-65$/month
Xem tệp đính kèm 1277426
Công cụ tính
https://calculator.aws/#/estimate
Sizing thì em chưa có kinh nghiệm chưa đánh giá được ạ. Em sẽ tìm hiểu thêm và update nếu được.
Nếu là on-premise hoặc private cloud thì em sẽ thay Amazon Kinesis bằng Apache Kafka —> Hadoop HDFS raw lake —> Spark clean & transform —> Apache Hive
Cơ mà em chưa có kinh nghiệm cho phần on-premise này vì em chỉ mới biết làm trên cloud thôi ạ. Em nghĩ concept nó sẽ giống nhau, cloud nó manage cho mình nên nhàn hơn còn làm on-premise phải tự setup và operate nó.
Dạ em DE mà em làm trái ngành, mới chuyển qua DE được 3 tháng á.