เปรียบเทียบ GPU สำหรับงาน AI
ตารางเทียบ RTX 5090, RTX PRO 6000, H200, B200 และ GB10 ทั้งขนาดหน่วยความจำ แบนด์วิดท์ และรูปแบบเครื่อง พร้อมวิธีอ่านสเปกให้ตรงกับงานจริง
คำถามแรกที่คนถามเวลาจะซื้อเครื่อง AI คือ “การ์ดตัวไหนดีที่สุด” ซึ่งเป็นคำถามที่ตอบไม่ได้ถ้ายังไม่รู้ว่าจะเอาไปทำอะไร ตารางข้างล่างจึงไม่จัดอันดับ แต่วางสเปกที่ผู้ผลิตประกาศไว้ข้างกัน ให้เทียบจากงานของคุณเอง
| GPU | หน่วยความจำ | แบนด์วิดท์ | รูปแบบ | งานที่เหมาะ |
|---|---|---|---|---|
| GeForce RTX 5090 | 32 GB GDDR7 | 1,792 GB/s | การ์ด PCIe สองสล็อต | เครื่องเดียว หนึ่งถึงสองผู้ใช้ งานพัฒนาและโมเดลขนาดกลาง |
| RTX PRO 6000 Blackwell | 96 GB GDDR7 | 1,792 GB/s | การ์ด PCIe สองสล็อต | โมเดลใหญ่บนการ์ดใบเดียว รองรับผู้ใช้พร้อมกันหลายคน |
| GB10 (DGX Spark) | 128 GB unified LPDDR5X | 273 GB/s | เครื่องเดสก์ท็อปสำเร็จรูป | โหลดโมเดลใหญ่ไว้ทดลองและ fine-tune บนโต๊ะทำงาน |
| H200 SXM | 141 GB HBM3e | 4.8 TB/s | โมดูล SXM ในเครื่องแปด GPU | งานโปรดักชัน อินเฟอเรนซ์พร้อมกันจำนวนมาก และการเทรน |
| B200 SXM | 180 GB HBM3e | 8 TB/s | โมดูล SXM ในเครื่องแปด GPU | คลัสเตอร์เทรนและเสิร์ฟโมเดลขนาดใหญ่มาก |
อ่านสามคอลัมน์นี้ให้เป็น ก็ตัดสินใจได้เกินครึ่ง
หน่วยความจำ คือเพดาน ถ้าโมเดลกับ KV cache ใส่ลงไปไม่หมด งานก็ไม่เริ่ม ไม่ว่าการ์ดจะเร็วแค่ไหน นี่คือตัวเลขที่ต้องดูก่อนเสมอ
แบนด์วิดท์หน่วยความจำ คือความเร็วในการอ่านน้ำหนักโมเดล ซ้ำทุกครั้งที่สร้างหนึ่ง token งาน LLM ติดคอขวดที่ตรงนี้มากกว่าที่พลังคำนวณดิบ การ์ดที่มีหน่วยความจำเยอะแต่แบนด์วิดท์ต่ำจึงโหลดโมเดลใหญ่ได้ แต่ตอบช้ากว่า
รูปแบบเครื่อง ตัดสินว่าจะวางไว้ที่ไหนได้จริง โมดูล SXM ไม่ได้เสียบลงเคสตั้งโต๊ะ และการ์ดสองสล็อตที่กินไฟหลายร้อยวัตต์ ต้องการทั้งเพาเวอร์ซัพพลายและการระบายความร้อนที่รองรับ
การ์ดไหนเหมาะกับงานไหน
- RTX 5090 เหมาะกับนักพัฒนาหรือทีมเล็กที่รันโมเดลระดับ 8B ถึง 32B แบบ quantised บนเครื่องเดียว และยังใช้ทำงานกราฟิกกับวิดีโอได้ด้วย
- RTX PRO 6000 Blackwell คือทางเลือกเมื่อหน่วยความจำ 32 GB เริ่มไม่พอ 96 GB บนการ์ดใบเดียวทำให้โมเดลระดับ 70B แบบ quantised อยู่ในเครื่องเดียวได้โดยไม่ต้องแบ่งข้ามการ์ด
- GB10 ในเครื่อง DGX Spark ให้หน่วยความจำรวม 128 GB ในเครื่องขนาดโต๊ะทำงาน เหมาะกับการทดลองและปรับจูนโมเดลใหญ่ แต่แบนด์วิดท์ต่ำกว่าการ์ดแยกหลายเท่า จึงไม่ใช่เครื่องสำหรับให้บริการหลัก
- H200 เป็นจุดเริ่มของงานระดับโปรดักชันจริง หน่วยความจำ HBM3e กับแบนด์วิดท์ระดับหลาย TB/s ทำให้รับผู้ใช้พร้อมกันจำนวนมากได้ในเครื่องเดียว
- B200 อยู่ในระดับคลัสเตอร์ ถ้าโจทย์ยังไม่ใช่การเทรนโมเดลของตัวเองหรือให้บริการระดับหลายพันคน ปกติยังไม่ต้องคุยถึงระดับนี้
สิ่งที่ตารางนี้ไม่ได้บอก
เราไม่ลงตัวเลข tokens per second เพราะตัวเลขนั้นเปลี่ยนตามโมเดล ความยาว context ขนาด batch รันไทม์ที่ใช้ และเวอร์ชันไดรเวอร์ ตัวเลขที่เราไม่ได้วัดเอง เราไม่พิมพ์ลงเว็บ ถ้าต้องการตัวเลขจริง เราวัดให้ในสภาพแวดล้อมที่ตรงกับงานของคุณได้
- ราคาเปลี่ยนตามล็อต ตามผู้จัดจำหน่าย และตามช่วงเวลา
- ของบางรุ่นมีคิวรอ การวางแผนต้องนับเวลารอเข้าไปด้วย
- ไฟและความร้อนเป็นข้อจำกัดจริงในห้องที่ไม่ได้ออกแบบมาเพื่อเครื่องแบบนี้
- ซอฟต์แวร์บางตัวรองรับการ์ดบางรุ่นก่อนรุ่นอื่นเสมอ
สามคำถามก่อนตัดสินใจ
- โมเดลที่จะใช้ต้องการหน่วยความจำเท่าไร รวม KV cache แล้วหรือยัง
- มีคนใช้พร้อมกันกี่คนในชั่วโมงที่ยุ่งที่สุด ไม่ใช่ค่าเฉลี่ยทั้งวัน
- ห้องที่จะวางเครื่องรองรับไฟ ความร้อน และเสียงได้จริงหรือไม่
NVIDIA, RTX และ DGX เป็นเครื่องหมายการค้าของ NVIDIA Corporation เราอ้างถึงเพื่อระบุผลิตภัณฑ์จริงที่จัดหาให้ลูกค้าเท่านั้น และไม่ได้เป็นตัวแทนจำหน่ายที่ได้รับแต่งตั้ง