Bác đọc thêm slide của bác
@Fire Of Heart thì sẽ refine được concept.
Bác nhìn slide trang 5-6 , thì thấy tại 1 thời điểm T xác định, có thể có tối đa 5 Instruction. Slide bác Fire Of Heart rất chi tiết, trước mình học ĐH = tiếng Anh , nên ko biết là pipe-line Việt hóa thành
ống dẫn 
Trước thì ông thầy lấy ví dụ lắp ráp xe của Ford cho phần này.
Có nhiều stages ko tốn CPU-cycle , nếu hardware support thêm
Direct Memory Access (DMA), cho 1 vài instruction copy/swap thì tại stage như WB(writeback) CPU lại assign sang 1 bộ phận khác (MMU - memory management unit , GPU - graphic ...) .
Tức là 1 vài instruction, ko block việc fetch các câu instruction khác. Nên vẫn cùng 1 PC vs 1 ALU, nhiều instruction vẫn có thể pipe-line vào cùng 1 lúc. Tất nhiên, càng nhiều stages, kiến trúc hardware càng phức tạp.
Không phải instruction nào cũng tốn CPU-cycle,
MIPS chỉ là 1 kiến trúc đơn giản để dạy học.
Tóm lại, mình đưa pipe-line vào trong topic này, vì nó là 1 yếu tố ảnh hưởng đến khả năng concurrency vs multi-threading . Giusp cho việc nắm được idea chính ở đây là :
thread trên OS/application nó độc lập với
core/thread trên hardware -> việc của dev là muốn chiếm nhiều CPU-cycle hơn thì phải tăng số
thread -> tăng số instruction được fetch vào hardware tại 1 lúc nhiều nhất có thể. ( còn việc hardware optimize như thế nào là 1 câu chuyện sâu hơn nhiều)