เส้นพรมแดนประสิทธิภาพของการรัน LLM: จูนอย่างไรให้คุ้มทั้ง latency ต้นทุน และ throughput
The efficient frontier of LLM inference

Baseten เผยแพร่บทความเมื่อวันที่ 1 กันยายน 2026 อธิบายกรอบคิดที่ใช้ได้จริงสำหรับวิศวกรที่ต้อง deploy LLM ในโปรดักชัน แนวคิด "efficient frontier" ยืมมาจากทฤษฎีพอร์ตการลงทุน คือจุดสมดุลที่ดีที่สุดระหว่างเป้าหมายที่แข่งกันเองภายใต้ทรัพยากรจำกัด สำหรับการรัน LLM เป้าหมายสามตัวนั้นคือ latency (ความเร็วตอบต่อผู้ใช้หนึ่งคน), throughput (จำนวนโทเคนรวมที่ผลิตได้) และต้นทุน
แกนหลักของบทความคือการแยกเทคนิคออกเป็นสองกลุ่มที่ต่างกันโดยสิ้นเชิง กลุ่มแรกคือเทคนิคที่แค่ "ขยับตำแหน่งไปตามเส้นเดิม" — ได้อย่างเสียอย่าง ได้แก่ การปรับ batch size (batch เล็กช่วย latency แต่ลด throughput ส่วน batch ใหญ่ตรงกันข้าม), กลยุทธ์ parallelism (Tensor Parallelism เหมาะกับงานที่ไวต่อ latency ส่วน Expert และ Attention Data Parallelism เหมาะกับ throughput) และ quantization ซึ่งแลกคุณภาพโมเดลกับประสิทธิภาพการเสิร์ฟ
กลุ่มที่สองคือเทคนิคที่ "ผลักเส้นทั้งเส้นออกไป" ให้ผลดีขึ้นทุกมิติพร้อมกัน ได้แก่ การเขียน kernel ให้เหมาะสมและปรับปรุง runtime, speculative decoding (เทคนิคอย่าง EAGLE-3 ลด latency ด้วยการข้าม forward pass) และการแยก prefill กับ decode ออกจากกันสำหรับงานปริมาณสูง
ข้อสังเกตที่ใช้งานได้จริงที่สุดคือ "เส้นพรมแดนปร��สิทธิภาพนั้นขรุขระมาก" มีจุดตัดที่ไม่เป็นไปตามสัญชาตญาณ ซึ่งหาเจอได้ด้วยการทดลองกวาดค่า (empirical sweep) เท่านั้น ไม่ใช่การวิเคราะห์เชิงทฤษฎี
คำแนะนำสำหรับวิศวกรคือเลือกคอนฟิกให้ตรงกับรูปแบบทราฟฟิกจริงของตน — เลือก batch size ตามลักษณะงาน เลือกกลยุทธ์ parallelism ตามว่าให้ความสำคัญกับ latency หรือ throughput — และตระหนักว่าเทคนิคหลายตัวให้ผลแบบทวีคูณ คือทำให้เร็วขึ้นสองเท่าสองครั้ง จะได้ผลรวมสี่เท่า