LOWNLAB News
โปรแกรมมิ่งระดับ 7/10Cloudflare Blog · 3 สิงหาคม 2026

Cloudflare เผยเทคนิครัน Kimi และ GLM ในสเกลใหญ่ — ลด KV cache เป็น FP8 และบีบน้ำหนักโมเดลเป็น INT4

Smaller, faster, safer: running Kimi and GLM at scale

Cloudflare เผยแพร่บทความทางเทคนิคเมื่อวันที่ 3 สิงหาคม 2026 อธิบายว่าบริษัทให้บริการโมเดลภาษาขนาดใหญ่แบบเปิดอย่าง Kimi K2.6 ของ Moonshot และ GLM 5.2 ของ Z.ai ในสเกลใหญ่ได้อย่างไร โดยแจกแจงสามเทคนิคหลักพร้อมตัวเลขจริง

เทคนิคแรกคือการควอนไทซ์ KV cache จาก 16 บิต (BF16) ลงเป็น 8 บิต (FP8 แบบ e4m3) ซึ่งลดขนาดแคชลงครึ่งหนึ่ง สำหรับ Kimi K2.6 ทำให้เก็บ token ได้ราว 1.37 ล้าน token จากเดิม 686,000 token ที่ระดับ 64 คำขอพร้อมกัน FP8 ทำ throughput ได้ 2,192 token ต่อวินาที สูงกว่าจุดสูงสุดของ BF16 ราว 41% และลดต้นทุนต่อ token ลง 30% โดยผลทดสอบบน GSM8K, ARC-Easy, ARC-Challenge, MMLU และการตรวจความถูกต้องของ tool call แสดงความแตกต่างด้านความแม่นยำน้อยมาก

เทคนิคที่สองคือการบีบอัดน้ำหนักโมเดล GLM 5.2 จาก FP8 เป็น INT4 ทำให้ checkpoint ลดจาก 705 GB เหลือ 421 GB หรือลดลง 40% หน่วยความจำต่อ GPU ลดจากราว 88GB เหลือ 52GB บนการ deploy แบบ tensor-parallel 8 ทาง ซึ่งเปิดพื้นที่ให้เก็บ KV cache ได้ราว 1.18 ล้าน token ส่วน throughput ในขั้น decode เพิ่มขึ้นตั้งแต่ 55% ที่ระดับ concurrency ต่ำ ไปจนถึง 16% ที่ระดับสูง โดยความแม่นยำเปลี่ยนแปลงไม่ถึง 0.8 จุดในทุกเบนช์มาร์ก

เทคนิคที่สามคือการตรวจสอบความสมบูรณ์ของ KV cache ด้วยการติดแท็กและตรวจสอบระดับ page เพื่อป้องกันไม่ให้แคชที่ใช้ร่วมกันระหว่างคำขอหลายร้อยรายการปนเปื้อนกัน โดยมี overhead ด้าน throughput และ latency ต่ำกว่า 1%

ผลลัพธ์รวมคือวิศวกรสามารถให้บริการโมเดลที่ใหญ่ขึ้นและ context ยาวขึ้นบนฮาร์ดแวร์ชุดเดิม โดยความแม่นยำของโมเดลแทบไม่เปลี่ยน แต่ต้นทุนการดำเนินงานลดลงอย่างมีนัยสำคัญ

แหล่งอ้างอิง

อ่านต้นฉบับที่ Cloudflare Blog

https://blog.cloudflare.com/smaller-faster-safer-models/