thắc mắc Apache Spark : Không đọc được file

DeutschlandGreatAgain

Senior Member
Hi các fen
Cho mình hỏi ,sao cái Spark mình cài rồi
Nhưng đọc file thì toàn bị lỗi , tạo df cũng ko đọc được :boss:
Kiểu lỗi như này
1684251926240.png

PicklingError: Could not serialize object: IndexError: tuple index out of range

Fen nào giúp mình được thì mình gửi 100k card , hoặc cuối tuần lên SG mình mời cf.
Do h mới đụng tới cái này, mà data ko đọc được, ko phân tích được
Mình mới đụng tới Spark, nên chưa hiểu lắm.
 
Bạn copy full log rồi gửi lên để mọi người giúp cho dễ, cap màn thế này khó xem lắm. Ngoài ra thì bạn gửi cả version spark và python mà bạn cài lên nữa
 
Sửa lần cuối:
Bạn copy full log rồi gửi lên để mọi người giúp cho dễ, cap màn thế này khó xem lắm. Ngoài ra thì bạn gửi cả version spark và python mà bạn cài lên nữa
Thanks fen, tại lần đầu up bài nên ko biết up sao.
Pyspark : 3.3.1
Kernel xài là Python 3.11.1
Mình nghĩ là code ko sai, mà do cái phần mềm hay sao ah, lúc đổi qua Kernel khác thì cái được cái ko, nhưng 3.11.1 là hay xài nhất (cái mình đang xài)

Cái hình trên thì sửa lại được rồi (dòng xanh lá, mình viết lại) , nhưng tới khi dùng map(), filter(), thì không được, lỗi y như vậy (dòng màu đỏ) ,....Google rồi mà cũng no hope

Log : viết trên visual studio code:

spark = SparkSession(sc)

data_from_file = spark.read.csv(path='C:/Users/Nguyen Loc Phuoc/Desktop/DATA SCIENCE/Pyspark 1/VS14MORT.txt.gz', header=True).cache()

data_from_file.take(1)

def extractInformation(row):
import re
import numpy as np
selected_indices = [
2,4,5,6,7,9,10,11,12,13,14,15,16,17,18,
19,21,22,23,24,25,27,28,29,30,32,33,34,
36,37,38,39,40,41,42,43,44,45,46,47,48,
49,50,51,52,53,54,55,56,58,60,61,62,63,
64,65,66,67,68,69,70,71,72,73,74,75,76,
77,78,79,81,82,83,84,85,87,89
]

data_from_file_conv = data_from_file.map(extractInformation)
data_from_file_conv.map(lambda row: row).take(1)


Kết quả trả về là 1 array, mà chắc do cái Spark lúc cài ko biết miss chỗ nào ko , mà ko được:D
Thanks các fen nha.
 
ợc thì mình gửi 100k card , hoặc cuối tuần lên SG mình m
Thanks fen, tại lần đầu up bài nên ko biết up sao.
Pyspark : 3.3.1
Kernel xài là Python 3.11.1
Mình nghĩ là code ko sai, mà do cái phần mềm hay sao ah, lúc đổi qua Kernel khác thì cái được cái ko, nhưng 3.11.1 là hay xài nhất (cái mình đang xài)

Cái hình trên thì sửa lại được rồi (dòng xanh lá, mình viết lại) , nhưng tới khi dùng map(), filter(), thì không được, lỗi y như vậy (dòng màu đỏ) ,....Google rồi mà cũng no hope

Log : viết trên visual studio code:

spark = SparkSession(sc)

data_from_file = spark.read.csv(path='C:/Users/Nguyen Loc Phuoc/Desktop/DATA SCIENCE/Pyspark 1/VS14MORT.txt.gz', header=True).cache()

data_from_file.take(1)

def extractInformation(row):
import re
import numpy as np
selected_indices = [
2,4,5,6,7,9,10,11,12,13,14,15,16,17,18,
19,21,22,23,24,25,27,28,29,30,32,33,34,
36,37,38,39,40,41,42,43,44,45,46,47,48,
49,50,51,52,53,54,55,56,58,60,61,62,63,
64,65,66,67,68,69,70,71,72,73,74,75,76,
77,78,79,81,82,83,84,85,87,89
]

data_from_file_conv = data_from_file.map(extractInformation)
data_from_file_conv.map(lambda row: row).take(1)


Kết quả trả về là 1 array, mà chắc do cái Spark lúc cài ko biết miss chỗ nào ko , mà ko được:D
Thanks các fen nha.
Theo mình biết thì pyspark trên windows bác cần cài 1 cụm standalone, bác check xem đã cài java với spark master đã chạy chưa?
 
Theo mình biết thì pyspark trên windows bác cần cài 1 cụm standalone, bác check xem đã cài java với spark master đã chạy chưa?
java có cài rồi fen mà ko đc ,
Mình cũng ko hiểu tại sao
Nếu được, cuối tuần mình mời các fen cafe, trước là học hỏi , sau là có dịp làm quen
 
Mình tìm thấy thread này, bạn thử xóa python 3.11 and cài lại python 3.10.9 xem
3.10.9 : lúc chạy được, lúc không fen, mình ko hiểu sao, do thực sự mình ko chuyên về IT
Nhưng bữa mình check , hình như là nó fit với 3.11.1 nhất , ở đâu mình quên rồi !!!:rolleyes:
1684338135146.png


Nói thiệt, mình ko rành về IT lắm
Chỉ là học data tay ngang thôi, nhưng dự án đang cần PySpark
Nên rất cần các bạn biết về cái này, training cho mình.

Mình làm ở Long Thành (Đồng NAi) , nên mỗi cuối tuần ( T7, CN ) mới lên đc SG, bạn nào biết rõ về cái này , mình mong muốn được train (có trả phí, thỏa thuận) .
Có gì cứ inbox mình , mình cần học cơ bản trước

Cám ơn các Vozer ! :D
 
Hi các fen
Cho mình hỏi ,sao cái Spark mình cài rồi
Nhưng đọc file thì toàn bị lỗi , tạo df cũng ko đọc được :boss:
Kiểu lỗi như này
Xem tệp đính kèm 1838366
PicklingError: Could not serialize object: IndexError: tuple index out of range

Fen nào giúp mình được thì mình gửi 100k card , hoặc cuối tuần lên SG mình mời cf.
Do h mới đụng tới cái này, mà data ko đọc được, ko phân tích được
Mình mới đụng tới Spark, nên chưa hiểu lắm.
bác kiểm tra lại data_from_file có giá trị hay null vì như lỗi là báo index phần tử lỗi mà (k có phần tử 1 thì sao take được)
 
Thanks fen, tại lần đầu up bài nên ko biết up sao.
Pyspark : 3.3.1
Kernel xài là Python 3.11.1
Mình nghĩ là code ko sai, mà do cái phần mềm hay sao ah, lúc đổi qua Kernel khác thì cái được cái ko, nhưng 3.11.1 là hay xài nhất (cái mình đang xài)

Cái hình trên thì sửa lại được rồi (dòng xanh lá, mình viết lại) , nhưng tới khi dùng map(), filter(), thì không được, lỗi y như vậy (dòng màu đỏ) ,....Google rồi mà cũng no hope

Log : viết trên visual studio code:

spark = SparkSession(sc)

data_from_file = spark.read.csv(path='C:/Users/Nguyen Loc Phuoc/Desktop/DATA SCIENCE/Pyspark 1/VS14MORT.txt.gz', header=True).cache()

data_from_file.take(1)

def extractInformation(row):
import re
import numpy as np
selected_indices = [
2,4,5,6,7,9,10,11,12,13,14,15,16,17,18,
19,21,22,23,24,25,27,28,29,30,32,33,34,
36,37,38,39,40,41,42,43,44,45,46,47,48,
49,50,51,52,53,54,55,56,58,60,61,62,63,
64,65,66,67,68,69,70,71,72,73,74,75,76,
77,78,79,81,82,83,84,85,87,89
]

data_from_file_conv = data_from_file.map(extractInformation)
data_from_file_conv.map(lambda row: row).take(1)


Kết quả trả về là 1 array, mà chắc do cái Spark lúc cài ko biết miss chỗ nào ko , mà ko được:D
Thanks các fen nha.
Mình không rõ về spark python lắm nhưng mà read_csv mà tên file read .gz được à :waaaht:
 
Mình không rõ về spark python lắm nhưng mà read_csv mà tên file read .gz được à
Được fen, nên mới dùng Spark, theo mình hiểu là vậy, hình như dữ liệu lớn nó dùng Spark nhiều hơn
Còn cái gì lớn hơn thì chắc tìm hiểu sau.
Mình mới tìm hiểu spark do nhu cầu thôi
Chứ đó giờ csv ko :D
*****
Edit: có gì nói sai các fen sửa giúp, mình mới tìm hiểu nên có thể nói chưa chính xác !
 
Được fen, nên mới dùng Spark, theo mình hiểu là vậy, hình như dữ liệu lớn nó dùng Spark nhiều hơn
Còn cái gì lớn hơn thì chắc tìm hiểu sau.
Mình mới tìm hiểu spark do nhu cầu thôi
Chứ đó giờ csv ko :D
*****
Edit: có gì nói sai các fen sửa giúp, mình mới tìm hiểu nên có thể nói chưa chính xác !
fen học bigdata à
 

Thống kê chủ đề

Ngày tạo
DeutschlandGreatAgain,
Người trả lời cuối
lukhach1990,
Trả lời
18
Lượt xem
1.409
Quay lại
Lên đầu trang