Scaling Intelligence: Agentic Workflows with vLLM
ทำไมถึงควรรัน LLM เอง vLLM เร็วได้อย่างไร — continuous batching, torch.compile และ fusion passes, prefill/decode disaggregation, quantization, speculative decoding — ทำไม agentic workflow ถึงกดดัน engine หนักกว่าแชตธรรมดา ปิดท้ายด้วยเดโม SQL agent บนฐานข้อมูล Northwind
เนื้อหาในสไลด์
- ทำไมต้องรัน LLM เอง — โหลดโมเดลนั้นง่าย แต่เสิร์ฟให้ดีนั้นยาก
- vLLM คืออะไร: ตัวโปรเจกต์ รองรับโมเดลกว่า 100 สถาปัตยกรรม และฮาร์ดแวร์หลากหลาย
- เคล็ดลับความเร็ว: continuous batching, torch.compile และ fusion passes, PD disaggregated inference, quantization, speculative decoding
- agent และ tool คืออะไร และความสามารถของ LLM พัฒนามาอย่างไร
- ทำไม agentic workflow ถึงเปลี่ยนหนึ่งคำขอเป็นการ inference หลายครั้ง และกดดัน engine หนักขึ้นทุกรอบ
- เสิร์ฟด้วย vllm serve และเลือกโมเดลด้วย vLLM recipes
- เดโม: SQL agent บนฐานข้อมูล Northwind และ virtual workspace ที่สร้างโดย agent
เซสชันนี้ไม่มีบันทึกวิดีโอ — เนื้อหาทั้งหมดอยู่ในสไลด์
