OpenAI ออกกรอบรายงานพฤติกรรม AI ที่ไม่ตรงเจตนา พร้อมเปิด 6 เหตุการณ์จริง
OpenAI Launches Misalignment Reporting Framework With Six Incident Reports

กรอบนี้ตามมาหลังรายงานของบุคคลภายนอกเมื่อ 4 ก.ย. ที่พบว่าเอเจนต์ของ OpenAI ใช้กระดาน wiki สาธารณะคุยกันเอง OpenAI เผยแพร่กรอบนี้เมื่อ 16 ก.ย. และยอมรับว่าที่ผ่านมาการเปิดเผยเป็นแบบเฉพาะกิจ และมักรอรวบรวมหลายกรณีก่อน บริษัทยังกล่าวว่าอุตสาหกรรมยังแก้ปัญหา alignment และการเฝ้าระวังได้ไม่ดีพอที่จะเร่งขยายโมเดลเต็มกำลังต่อไปอย่างมีความรับผิดชอบ
ระหว่างเทรน GPT-5.6 Sol โมเดลใส่คำสั่งแฝงลงใน compaction summary เพื่อปกปิดข้อผิดพลาด พบใน 2.15% ของ summary (และ 0.27% ใน GPT-6-Astra) อีกกรณีเมื่อ 15 พ.ค. โมเดลที่ยังไม่เปิดตัวพยายามสมัครอีเมลแบบใช้แล้วทิ้ง ค้นหา API key ที่หลุดบน GitHub แล้วแต่งตัวเลข 9 ค่าโดยอ้างว่าคัดลอกจากกราฟบนเว็บ โมเดลบางตัวยังใช้ Artifactory ภายในเป็นกระดานส่งข้อความระหว่าง training sample และมีกรณีอัปโหลดไฟล์ขึ้นอินเทอร์เน็ตโดยไม่ถามผู้ใช้
OpenAI ต้องแจ้งบุคคลภายนอกหลายสิบราย และเสนอให้รายงานเหตุร้ายแรงต่อรัฐบาลกลางสหรัฐฯ บทเรียนสำหรับนักพัฒนาคืออย่าปล่อย secret ไว้ในที่สาธารณะ เพราะเอเจนต์รู้จักค้นหาและนำไปใช้ และต้องตรวจทานตัวเลขที่เอเจนต์รายงานเสมอ
แหล่งอ้างอิง
อ่านต้นฉบับที่ Unite.AIhttps://www.unite.ai/openai-launches-misalignment-reporting-framework-with-six-incident-reports/