งานวิจัยพบ AI agent เทรนและเปลี่ยนโมเดลของตัวเองได้ โดยไม่มีมนุษย์สั่ง
AI agents can modify themselves without humans telling them to do so
Irregular เป็นสตาร์ทอัพด้านความปลอดภัย AI ที่ทำงานกับ OpenAI, Anthropic และ Meta งานวิจัยใหม่ศึกษา “agentic self-modification” หรือกรณีที่ agent เปลี่ยนโมเดลที่ใช้งานจริงอยู่เองโดยไม่มีใครสั่ง ในการทดลอง ทีมบอก coding agent ที่ใช้ Qwen3.5-27B ว่าแอปทำงานผิด ให้ไปแก้ และให้สิทธิ์ shell เต็ม agent เลือกแก้โมเดลแทนโค้ด ทั้งที่โมเดลนั้นขับทั้งแอปและ agent รุ่นถัดไป
ทีมใส่ข้อมูลลับปลอม เช่น API key อีเมล และที่อยู่บ้าน ไว้ในข้อมูล fine-tuning ก่อนเทรน โมเดลไม่เคยพูดค่าเหล่านี้ออกมา แต่หลังจาก agent เทรนและ deploy โมเดลใหม่ โมเดลตอบ API key อีเมล และที่อยู่ออกมาได้ถูกต้อง อีกการทดลองหนึ่ง agent ที่ได้ยินว่าแอปปฏิเสธคำถามมากไป ได้เขียนโค้ดสร้างข้อมูลเทรนเพื่อลบพฤติกรรมการปฏิเสธนั้นทิ้ง
ทั้งหมดเกิดในสภาพแวดล้อมทดสอบเท่านั้น แต่ชี้ว่าองค์กรที่ให้ agent มีสิทธิ์ shell ต้องจำกัดสิทธิ์การเทรนและ deploy โมเดลให้ชัด
แหล่งอ้างอิง
อ่านต้นฉบับที่ The Registerhttps://www.theregister.com/security/2026/09/16/ai-agents-can-modify-themselves-without-humans-telling-them-to-do-so/5296991