← ดูงานทั้งหมด

จัดไปแล้วจัดโดยคอมมูนิตี้ของเรา

Pie & AI: Bangkok - Embedded AI

meetup คอมมูนิตี้ของ DeepLearning.AI จัดโดย AGICAFET

วันและเวลา
13:00–18:00 · เวลาประเทศไทย (ICT, UTC+7)
สถานที่
Cleverse พระราม 9Bangkok
จัดโดย
AGICAFET ↗ ร่วมกับ DeepLearning.AI Pie & AI community

งานนี้จัดไปแล้ว สไลด์ยังเปิดดูได้ที่นี่

สไลด์เปิดงาน Pie & AI: a sweet meetup for deep learners โดย DeepLearning.AI

เซสชันและสไลด์

บรรยาย

NVIDIA Isaac & Ecosystem Future of the Physical AI

Natdhanai PraneenatthaveeAGICAFET

AGICAFET เข้าร่วม NVIDIA Inception Program แล้ว Natdhanai Praneenatthavee พาดูว่าความสามารถของหุ่นยนต์ขยายจาก specialist ไปสู่ generalist ได้อย่างไร ทำไมข้อมูลฝึกถึงเป็นความท้าทายใหญ่ของงานหุ่นยนต์ และเวิร์กโฟลว์ครบวงจรของ NVIDIA — collect, curate, simulate, train และ evaluate ใน Isaac Lab แล้ว deploy ด้วย Isaac ROS — ต่อด้วย Isaac GR00T, agent ที่รวม skill, tool และ context สำหรับ physical AI และเดโมแขนกลที่แสดงการนำ GapONet มาใช้กับการฝึก RL policy

เนื้อหาในสไลด์

  • AGICAFET เข้าร่วม NVIDIA Inception Program: ทำให้ AI inference เร็วขึ้น เบาลง และถูกลง
  • ขยายความสามารถของหุ่นยนต์สู่โลกจริง: จาก specialist สู่ generalist และองค์ประกอบของระบบอัตโนมัติ
  • ข้อมูลฝึกคือความท้าทายใหญ่ของงานหุ่นยนต์ และ compute ก็คือข้อมูล: teleoperation, simulation, ข้อมูลจากอินเทอร์เน็ตและข้อมูลสังเคราะห์ ไปจนถึง world foundation model
  • เวิร์กโฟลว์พัฒนาหุ่นยนต์ครบวงจร: เก็บ คัดกรอง และสังเคราะห์ข้อมูลด้วย Omniverse และ Cosmos ฝึกใน Isaac Lab ประเมินใน Isaac Lab Arena และ deploy ด้วย Isaac ROS
  • NVIDIA Isaac GR00T: เวิร์กโฟลว์สำหรับพัฒนาหุ่นยนต์ฮิวแมนนอยด์ตั้งแต่ข้อมูลจนถึงการ deploy
  • Agents at work: skill, tool และ context รวมถึงเครื่องมือของ agent และโมเดลเปิดสำหรับ physical AI
  • เดโม: การนำ GapONet มาใช้กับการฝึก RL policy บนแขนกลขนาดเล็ก
เปิด PDF24 หน้า · 3.9 MB
บรรยาย

Your GPUs are doing the same work twice: KV-cache reuse for faster, cheaper LLM inference

Dai TranTensormesh

บนฮาร์ดแวร์ของคุณเอง ทุกคำขอต้องคำนวณ context เดิมซ้ำโดยไม่ปรากฏในบิล Dai Tran อธิบายว่า KV cache คืออะไร ทำไม prefix caching ถึงช่วยได้แค่บางส่วน LMCache, CacheGen และ CacheBlend เก็บและนำ cache กลับมาใช้ข้ามคำขอและข้ามอินสแตนซ์ได้อย่างไร ผลวัดจริง (time-to-first-token เร็วขึ้นราว 3 เท่าที่คุณภาพเท่าเดิม) และการวางเลเยอร์นี้ลงใน stack ที่รัน vLLM อยู่แล้วแบบ on-prem

เนื้อหาในสไลด์

  • ปัญหา: บนฮาร์ดแวร์ของคุณเอง คุณจ่ายเพื่อคำนวณ context เดิมซ้ำ
  • จุดบอด: ทุกคนดู GPU utilisation แต่แทบไม่มีใครดู KV-cache hit rate
  • พื้นฐาน: KV cache คืออะไร และทำไมควรมองเป็นข้อมูล ไม่ใช่พื้นที่ทิ้ง
  • prefix caching หยุดตรงไหน และ open-source stack ที่ไปต่อได้: LMCache, CacheGen, CacheBlend
  • หลักฐาน: TTFT เร็วขึ้นราว 3 เท่าที่คุณภาพเท่าเดิม และงานแบบไหนที่คุ้มที่สุด
  • สถาปัตยกรรม: เลเยอร์ที่วางลงใน vLLM และ stack เดิมได้ ทั้งแบบ managed และ self-hosted
  • เช็กลิสต์ 30 วินาที: KV-cache reuse คุ้มสำหรับคุณไหม
เปิด PDF22 หน้า · 2.1 MB
บรรยาย

Practical Edge AI: From Runtime Choices to Real-World Product Challenges

Sattaya SingkulTrue Digital Group

ไม่ใช่แค่ deploy โมเดลครั้งเดียว แต่ต้องดูแลให้มันทำงานต่อบนอุปกรณ์ที่คุณมองไม่เห็น Sattaya Singkul พาไล่ตั้งแต่สเปกตรัม edge-to-cloud ภูมิทัศน์ runtime ที่กระจัดกระจาย (เจ็ดเอนจิน เจ็ดกรอบฮาร์ดแวร์) การรัน LLM บนมือถือด้วย LiteRT-LM, speculative decoding การ benchmark บนอุปกรณ์จริง และการแบ่งงานระหว่าง edge กับ cloud โดยให้สถาปัตยกรรมเป็นตัวตัดสินเรื่องความเป็นส่วนตัว

เนื้อหาในสไลด์

  • Edge AI ในหนึ่งบรรทัด และทำไม "edge" คือสเปกตรัม ไม่ใช่สถานที่
  • ภูมิทัศน์ runtime ที่กระจัดกระจาย: เจ็ดเอนจิน เจ็ดกรอบฮาร์ดแวร์ ไม่มีผู้ชนะรายเดียว
  • รัน LLM บนมือถือแบบตรงไปตรงมา: LiteRT-LM และ Gemma แบบ mixed 2/4/8-bit บนอุปกรณ์
  • speculative decoding เร่งความเร็วได้อย่างไรจริง ๆ
  • วัด อย่าเดา: benchmark บนอุปกรณ์จริงด้วย AI Edge Portal
  • edge กับ cloud คือสเปกตรัม: ตัดสินใจทีละขั้นตอนบนสี่แกน ให้สถาปัตยกรรมเป็นตัวคุ้มครองความเป็นส่วนตัว
  • ตัวเลขที่ลืมวัด: inference time ไม่ใช่ latency และเดโมจบตรงที่โปรดักต์เริ่ม
เปิด PDF20 หน้า · 2.3 MB
บรรยาย

Local AI for Autonomous Vehicles: From CARLA Decision-Making to Context-Aware and Resilient Urban Mobility

Aueaphum AueawatthanaphisutTensai Thaizen Co., Ltd.

รัน stack ของรถยนต์ไร้คนขับแบบ local: ระดับ SAE และ NVIDIA Alpamayo 2 Super ชุดเซนเซอร์ digital twin และ CARLA simulator แบบโอเพนซอร์สที่กำหนดสภาพจราจรได้ Aueaphum Aueawatthanaphisut พาดูสี่สถานการณ์การตัดสินใจ และงานวิจัยเบื้องหลัง: การตัดสินใจแบบ context-aware ด้วย LLM เครือข่ายเซนเซอร์ริมทางเพื่อความทนทาน และ reinforcement learning เสริมด้วย LLM สำหรับจัดลำดับรถฉุกเฉิน

เนื้อหาในสไลด์

  • รถยนต์ไร้คนขับวันนี้: ระดับ SAE และ NVIDIA Alpamayo 2 Super โมเดล VLA แบบ reasoning สำหรับการขับขี่ระดับ 4
  • ชุดเซนเซอร์ (กล้อง เรดาร์ LiDAR) และ digital twin สำหรับระบบยานยนต์
  • CARLA: simulator โอเพนซอร์ส สถาปัตยกรรม client-server, NPC และการจัดองค์ประกอบจราจร
  • สี่สถานการณ์การตัดสินใจใน CARLA: รถฝ่าไฟแดง สิ่งกีดขวางบนถนน การเบรกกะทันหัน และการเปลี่ยนเลนฉุกเฉิน พร้อมการทำนายคนข้ามถนน
  • การตัดสินใจแบบ context-aware ในรถยนต์ไร้คนขับด้วยการจำลองพฤติกรรมทางสังคมและ LLM
  • ความทนทาน: เครือข่ายเซนเซอร์ริมทางเพื่อการรับรู้ที่แม่นยำในสภาพแวดล้อมที่ยาก
  • reinforcement learning เสริมด้วย LLM สำหรับจัดลำดับรถฉุกเฉินภายใต้จราจรเมืองที่หนาแน่น
เปิด PDF35 หน้า · 8.2 MB
บรรยาย

Mamba Inference on MCUs

Friso SmitTU Delft

Mamba สถาปัตยกรรม state space model ที่เปิดตัวปลายปี 2023 จะรันบนไมโครคอนโทรลเลอร์ที่มี RAM แค่ 512 KB ได้ไหม Friso Smit เปรียบเทียบกับ transformer สร้าง pipeline จาก PyTorch ผ่าน ONNX ไปยัง ESP-DL พร้อมค้นหาพารามิเตอร์ด้วย Optuna และ quantization แบบ int8 แล้วรายงาน latency และความแม่นยำบน ESP32-S3 สำหรับงานจำแนกกิจกรรมของมนุษย์และการตรวจจับคำสั่งเสียง

เนื้อหาในสไลด์

  • Mamba คืออะไร: จาก recurrent network สู่ state space model และ selective state space model
  • ฮาร์ดแวร์เป้าหมาย: ESP32-S3 ซีพียูดูอัลคอร์ 240 MHz, RAM 512 KB และแฟลช 8 MB น้อยกว่าสมาร์ตโฟนราว 1000 เท่า
  • ทำไมต้อง Mamba: หน่วยความจำคงที่และเวลาเชิงเส้น ขณะที่ transformer ใช้ทั้งสองอย่างเพิ่มขึ้นตามความยาว sequence, ผลเทียบ throughput กับ scaling และโมเดลไฮบริดอย่าง Nemotron 3 และ Jamba
  • คำถามและความท้าทายของงานวิจัย: Mamba เหมาะกับ MCU ไหม จะเปรียบเทียบสถาปัตยกรรมอย่างไร และการฝึกบน PC เพื่อไปรันบนชิปที่ทรัพยากรน้อยกว่า GPU มาก
  • เครื่องมือ: Optuna สำหรับค้นหาไฮเปอร์พารามิเตอร์, PyTorch, ONNX และ ESP-DL พร้อมเทคนิค optimization อย่าง bidirectional Mamba, lookup table และ quantization แบบ int8
  • ผลการทดลองกับงานจำแนกกิจกรรมของมนุษย์และการตรวจจับคำสั่งเสียง: profiling ระดับ operator, ความแม่นยำเทียบ latency, ผลกระทบของ quantization และการเทียบกับโมเดล MCU อื่น
  • สรุปและงานต่อไป: Mamba มีศักยภาพใช้บน MCU ได้ดีมาก แต่ซอฟต์แวร์ที่รองรับยังมีจำกัด และ quantization แบบไม่ฝึกใหม่ยังได้ผลจำกัด ขั้นต่อไปคือปรับปรุง quantization (PTQ หรือ QAT), สร้าง kernel เฉพาะสำหรับ Mamba และเพิ่ม Mamba-2 พร้อมเทียบกับโมเดลอื่นอย่าง transformer
เปิด PDF34 หน้า · 6.0 MB

กำหนดการ

จากกำหนดการในวันงาน เซสชันที่มีสไลด์ลิงก์ไปยังรายละเอียดด้านบน

  1. 12:30 – 13:00

    ลงทะเบียน

  2. 13:00 – 13:15

    เปิดงาน Pie & AI

    Andrew Ng

  3. 13:15 – 13:30

  4. 13:30 – 14:00

    Agentic Orchestrate on the Local

    IBM

  5. 14:00 – 14:30

  6. 14:40 – 15:00

    พักเบรก

  7. 15:00 – 15:30

  8. 15:30 – 16:00

  9. 16:00 – 16:30

  10. 16:30 – 17:00

    Let vLLM decide which skill to use from a massive skill collection

    Datakarate

  11. 17:15 – 18:00

    เน็ตเวิร์กกิ้ง

เวลาทั้งหมดเป็นเวลาประเทศไทย (ICT, UTC+7)

เกี่ยวกับงานนี้

บ่ายวันเสาร์ว่าด้วย AI บนอุปกรณ์ปลายทาง จัดโดย AGICAFET ในฐานะ meetup Pie & AI ของ DeepLearning.AI ที่ Cleverse พระราม 9 เปิดงานโดย Andrew Ng ตามด้วยเซสชัน NVIDIA Isaac กับ physical AI (AGICAFET), agentic orchestration บนฮาร์ดแวร์ในองค์กร (IBM), การนำ KV cache กลับมาใช้ซ้ำ (Tensormesh), Edge AI ในงานจริง (True Digital), Local AI สำหรับรถยนต์ไร้คนขับ (Aueaphum Aueawatthanaphisut), Mamba inference บนระบบฝังตัว (Friso Smit) และให้ vLLM เลือก skill ที่เหมาะจากคลังขนาดใหญ่ (Datakarate) ปิดท้ายด้วยเน็ตเวิร์กกิ้ง

ที่ร่วมอยู่ในงานนี้

  • DeepLearning.AI
  • IBM
  • Tensormesh
  • True Digital
  • Datakarate
  • Cleverse

ติดตามข่าวสาร

อีเมลเป็นครั้งคราวเกี่ยวกับ vLLM Bangkok Day และสิ่งที่คอมมูนิตี้ vLLM ไทยกำลังสร้าง ไม่มีสแปม ยกเลิกได้ทุกเมื่อ