สตอเรจและเน็ตเวิร์กสำหรับ AI
วางชั้นสตอเรจ NVMe, SSD และ HDD สำหรับโมเดลกับชุดข้อมูล และเลือกความเร็วเครือข่ายตั้งแต่ 1GbE ถึง InfiniBand ให้พอดีกับงาน
เกือบทุกโครงการที่เราเข้าไปแก้ ปัญหาไม่ได้อยู่ที่ GPU แต่อยู่ที่ข้อมูลเดินทางมาถึง GPU ไม่ทัน การ์ดที่แพงที่สุดก็รอเฉยๆ ถ้าดิสก์อ่านช้าหรือเครือข่ายคอขวด หน้านี้คือวิธีวางสองส่วนนั้นให้พอดี ไม่ใช่ให้เกิน
สตอเรจแบ่งเป็นสี่ชั้น
อย่าซื้อ NVMe ความจุมหาศาลเพื่อเก็บทุกอย่าง แยกของร้อนออกจากของเย็นแล้วจ่ายเงินตามความเร็วที่จำเป็นจริง
| ชั้นข้อมูล | สื่อบันทึก | ขนาดที่แนะนำ | ทำไม |
|---|---|---|---|
| โมเดลที่กำลังใช้งาน | NVMe SSD | 1 – 4 TB | โหลดโมเดลเข้า VRAM ตอนเริ่มระบบ ยิ่งเร็วยิ่งกลับมาให้บริการไว |
| ชุดข้อมูลที่ใช้บ่อย | NVMe SSD | 2 – 8 TB | ดัชนี RAG, เอกสารที่แปลงแล้ว และไฟล์ที่อ่านซ้ำทั้งวัน |
| ข้อมูลดิบและ checkpoint | SATA SSD หรือ HDD | 8 – 100 TB | เก็บของตั้งต้นและผลการเทรน ไม่ต้องเร็ว แต่ต้องพอ |
| สำรองข้อมูล | NAS หรือเทป แยกเครื่อง | เท่าชั้นบนรวมกัน | ระบบ AI ในองค์กรถือข้อมูลจริง จึงต้องมีสำเนาที่กู้คืนได้ |
เครือข่าย เริ่มที่เท่าไรถึงพอ
คำถามที่ถูกไม่ใช่ “เร็วที่สุดเท่าไร” แต่คือ “ข้อมูลต้องวิ่งจากไหนไปไหน” ถ้าโมเดลกับข้อมูลอยู่เครื่องเดียวกัน เครือข่ายแทบไม่มีผล แต่ถ้าสตอเรจอยู่คนละเครื่อง หรือมีหลาย GPU ต้องซิงก์กัน เครือข่ายจะกลายเป็นตัวกำหนดความเร็วทันที
| ระดับ | อุปกรณ์ | เหมาะกับ | ทำไม |
|---|---|---|---|
| 1GbE | สายทองแดงที่มีอยู่แล้ว | เครื่องเดียว ผู้ใช้ไม่กี่คน | พอสำหรับแชตและถามตอบ แต่ย้ายชุดข้อมูลช้ามาก |
| 10GbE | SFP+ หรือ 10GBASE-T | เซิร์ฟเวอร์เดียวกับ NAS | จุดเริ่มต้นที่เหมาะสำหรับองค์กร ย้ายข้อมูลเข้าออกได้จริง |
| 25 – 100GbE | SFP28 หรือ QSFP28 | หลายเครื่องแชร์สตอเรจ | เมื่อสตอเรจอยู่คนละเครื่องกับ GPU และต้องอ่านพร้อมกัน |
| RDMA หรือ InfiniBand | การ์ดและสวิตช์เฉพาะทาง | เทรนข้ามหลายเครื่อง | จำเป็นเมื่อ GPU ต้องซิงก์กันข้ามเครื่อง ไม่ใช่แค่รับงานเข้ามา |
จุดตั้งต้นที่ใช้ได้กับองค์กรส่วนใหญ่
- NVMe ในเครื่อง GPU สำหรับโมเดลและดัชนีที่ใช้อยู่ เพื่อให้ระบบกลับมาให้บริการได้เร็วหลังรีสตาร์ต
- NAS หรือเซิร์ฟเวอร์สตอเรจแยกสำหรับข้อมูลดิบและ checkpoint เชื่อมด้วย 10GbE เป็นอย่างน้อย
- สำเนาสำรองที่อยู่คนละเครื่องกับต้นฉบับ และทดสอบกู้คืนอย่างน้อยปีละครั้ง
- ค่อยขยับขึ้น 25GbE หรือสูงกว่า เมื่อมีเครื่องที่สองที่ต้องอ่านข้อมูลชุดเดียวกัน
PDPA กับการวางสตอเรจ
เหตุผลหลักที่ลูกค้าเลือกติดตั้งระบบ AI ในองค์กรเอง คือข้อมูลส่วนบุคคลต้องไม่ออกนอกองค์กร การวางสตอเรจจึงมีข้อกำหนดเพิ่มจากเรื่องความเร็ว
- เข้ารหัสข้อมูลที่พัก และจำกัดสิทธิ์การเข้าถึงตามหน้าที่
- แยกชุดข้อมูลที่มีข้อมูลส่วนบุคคลออกจากชุดข้อมูลทั่วไปตั้งแต่ต้น
- เก็บบันทึกการเข้าถึง เพื่อตอบคำถามได้ว่าใครอ่านอะไรเมื่อไร
- กำหนดอายุการเก็บ และลบจริงเมื่อครบกำหนด รวมถึงในสำเนาสำรอง
เราออกแบบชั้นสตอเรจให้สอดคล้องกับนโยบายข้อมูลขององค์กรตั้งแต่ตอนวางสเปก เพราะการย้ายข้อมูลทีหลังแพงกว่าการวางให้ถูกตั้งแต่แรกเสมอ