วิศวกร AI · การทดลอง

LAB

คำถามเรื่อง AI ขนาดเล็กที่รันเป็น simulation แบบ deterministic ทุกอย่างทำงานในเบราว์เซอร์ของคุณ — ไม่มี API ไม่มี key และไม่มีการอ้างตัวเลข benchmark ใด ๆ ทำให้พังได้เลย นั่นแหละคือประเด็น

USER RETRIEVE AGENT TOOL EVALUATE OUTPUT
แผนภาพ: รอยการทดลอง ตั้งแต่รัน ทดสอบ จนถึงการประเมินผล
  1. EXP 001 Agent Trace เมื่อ agent ตอบผิด มันพลาดตอนไหนของเส้นทาง? AGENTS ข้อมูลจำลอง
  2. EXP 002 RAG Retrieval ถ้า chunk ที่ดีที่สุดถูกทำให้เสียหาย ระบบจะยังตอบถูกไหม? RAG ข้อมูลจำลอง
  3. EXP 003 Evaluation เปลี่ยนเกณฑ์ให้คะแนนแล้ว ระบบเดิม "ดีขึ้น" จริงหรือ? EVALUATION ข้อมูลจำลอง
  4. EXP 004 Context Window ข้อมูลสำคัญหลุดออกจาก context เมื่อไหร่? CONTEXT ข้อมูลจำลอง