VRAM ที่ต้องใช้สำหรับ LLM
วิธีคำนวณ VRAM สำหรับ Qwen, Llama และ DeepSeek ตามขนาดโมเดลและ quantisation พร้อมตารางอ้างอิงและตัวอย่างการวางสเปกจริงสามแบบ
การเลือกเครื่อง AI เริ่มจากคำถามเดียว คือโมเดลที่จะใช้กินหน่วยความจำเท่าไร ทุกอย่างที่เหลือ ทั้งรุ่นการ์ด จำนวนการ์ด ขนาดเพาเวอร์ซัพพลาย และการระบายความร้อน ตามมาจากตัวเลขนี้
สูตรคร่าวๆ ที่ใช้ได้จริง
หน่วยความจำที่ต้องมี เท่ากับสามก้อนบวกกัน
- น้ำหนักโมเดล เท่ากับจำนวนพารามิเตอร์คูณด้วยจำนวนไบต์ต่อพารามิเตอร์ ที่
FP16คือ 2 ไบต์ ที่Q8ประมาณ 1 ไบต์ และที่Q4ประมาณ 0.5 ถึง 0.6 ไบต์ - KV cache คือหน่วยความจำที่ใช้จำบทสนทนาที่กำลังทำอยู่ โตตามความยาว context และตามจำนวนคนที่ถามพร้อมกัน ก้อนนี้คือก้อนที่คนลืมบ่อยที่สุด
- ส่วนเผื่อของระบบ ทั้งรันไทม์ บัฟเฟอร์ และการจัดสรรชั่วคราว เผื่อไว้ประมาณ 10 ถึง 20 เปอร์เซ็นต์
ตัวอย่าง โมเดล 32B ที่ Q4 มีน้ำหนักราว 20 GB ถ้ามีคนใช้พร้อมกันสิบคนที่ context ยาวปานกลาง ให้เผื่อ KV cache อีกหลายกิกะไบต์ รวมกับส่วนเผื่อระบบแล้ว การ์ด 32 GB จะเริ่มตึง ส่วนการ์ด 48 GB ขึ้นไปจะทำงานได้สบาย
quantisation ย่อโมเดลได้แค่ไหน
quantisation คือการเก็บน้ำหนักโมเดลด้วยความละเอียดที่ต่ำลง เพื่อให้ใส่การ์ดได้และอ่านได้เร็วขึ้น แลกกับคุณภาพที่ลดลงเล็กน้อย ในงานธุรกิจส่วนใหญ่ Q4 ให้ผลที่ยอมรับได้และประหยัดหน่วยความจำเกือบสี่เท่า เทียบกับ FP16 งานที่ต้องการความแม่นยำสูงมาก เช่น การสรุปสัญญาหรือการคำนวณตัวเลข ควรทดสอบเทียบกันก่อนตัดสินใจ
| โมเดล | 4-bit (Q4) | 16-bit (FP16) | เหมาะกับงาน |
|---|---|---|---|
| Qwen3 8B | 5 – 6 GB | 16 – 18 GB | ผู้ช่วยงานทั่วไป เครื่องเดียวก็พอ |
| Qwen3 14B | 9 – 11 GB | 28 – 32 GB | สรุปเอกสารและตอบคำถามภาษาไทยได้ดีขึ้น |
| Qwen3 32B | 19 – 22 GB | 64 – 70 GB | จุดคุ้มค่าที่พบบ่อยสำหรับ RAG ในองค์กร |
| DeepSeek-R1 Distill 32B | 19 – 22 GB | 64 – 70 GB | งานที่ต้องการการให้เหตุผลเป็นขั้นตอน |
| Llama 3.3 70B | 40 – 45 GB | 140 – 150 GB | ต้องการการ์ดหน่วยความจำสูงหรือหลายใบ |
| Qwen3 235B (MoE) | 130 – 150 GB | 460 – 500 GB | ระดับเซิร์ฟเวอร์ ต้องวางหลาย GPU ตั้งแต่ต้น |
| DeepSeek-V3 / R1 671B (MoE) | 370 – 420 GB | 1.3 – 1.4 TB | ระดับคลัสเตอร์ ประเมินร่วมกับเครือข่ายและสตอเรจ |
ตัวอย่างการวางสเปกจริงสามแบบ
ทีม 15 คน ใช้ผู้ช่วยตอบคำถามจากเอกสารภายใน
โมเดลระดับ 32B ที่ Q4 เพียงพอสำหรับงานสรุปและถามตอบภาษาไทย น้ำหนักราว 20 GB บวก KV cache สำหรับคนใช้พร้อมกันไม่เกินสิบคน เวิร์กสเตชันการ์ดเดียวที่มีหน่วยความจำ 48 GB ขึ้นไปจบงานได้ และยังเหลือที่ให้โมเดล embedding สำหรับ RAG อยู่ในเครื่องเดียวกัน
ทีมวิจัยที่ต้องใช้โมเดลระดับ 70B
Llama 3.3 70B ที่ Q4 ต้องการราว 40 ถึง 45 GB เฉพาะน้ำหนัก ทางเลือกคือการ์ดใบเดียวที่มีหน่วยความจำ 96 GB ซึ่งง่ายกว่าการแบ่งโมเดลข้ามการ์ดสองใบมาก ทั้งเรื่องการตั้งค่าและเรื่องความเร็ว
ทั้งองค์กร 200 คน พร้อมระบบค้นเอกสาร
ที่ระดับนี้ตัวแปรหลักไม่ใช่ขนาดโมเดลอีกต่อไป แต่เป็นจำนวนคำถามพร้อมกัน ซึ่งทำให้ KV cache กลายเป็นก้อนที่ใหญ่กว่าน้ำหนักโมเดลได้ เครื่องระดับเซิร์ฟเวอร์ที่มีหน่วยความจำ HBM สูงและแบนด์วิดท์สูง จะคุ้มกว่าการวางเวิร์กสเตชันหลายเครื่องแล้วให้คนแย่งกันใช้
ข้อควรระวังที่เจอบ่อย
- คิดจากค่าเฉลี่ยผู้ใช้ทั้งวัน แทนที่จะคิดจากชั่วโมงที่ยุ่งที่สุด
- ลืมว่าระบบ RAG ต้องโหลดโมเดล embedding และบางครั้งโมเดล rerank ไว้ในเครื่องเดียวกันด้วย
- ตั้ง context ยาวสุดไว้ตั้งแต่แรกโดยไม่จำเป็น ซึ่งกิน KV cache เพิ่มขึ้นอย่างมากโดยที่ผู้ใช้ไม่ได้ประโยชน์
- ซื้อการ์ดที่พอดีเป๊ะกับโมเดลวันนี้ แล้วไม่เหลือที่ให้โมเดลรุ่นถัดไป