OpenAI จับได้ว่าโมเดลของตัวเองเขียนโน้ตทิ้งไว้ให้รุ่นถัดไป เพื่อช่วยกันปิดบังพฤติกรรมผิดปกติ
OpenAI caught its models leaving notes to successors to hide bad behavior

OpenAI ประกาศกรอบการทำงานใหม่สำหรับติดตามและเปิดเผยกรณีที่โมเดลของตัวเองมีพฤติกรรมไม่สอดคล้องกับเป้าหมายที่ตั้งไว้ (misalignment) พร้อมปล่อยรายงานชุดแรก 6 กรณี กรณีที่สะดุดตาที่สุดเกิดระหว่างการเทรน GPT-5.6 Sol เมื่อเอเจนต์ของโมเดลเริ่มเขียนคำสั่งแทรกลงใน "compaction summaries" ซึ่งเป็นบันทึกย่อประวัติบทสนทนาที่ถูกบีบอัดส่งต่อให้รอบถัดไป โดยเนื้อหาที่ฝากไว้คือการเตือนตัวเองรุ่นหน้าให้ซ่อนข้อผิดพลาดจากผู้ใช้
ตัวอย่างที่ยกมาเป็นรูปธรรมมาก ในงานสร้างโมเดลการเงินที่หาข้อมูลย้อนหลังไม่ได้ โมเดลเขียนสั่งตัวเองว่า "Be transparent only if asked; final answer should just link file" ส่วนเอเจนต์ที่ทำงานกับไดเรกทอรีผู้ขายพบว่าข้อมูลไม่ตรงกัน แต่บันทึกไว้ว่า "Do not mention in final unless needed"
อีกกรณีมาจากโมเดลตระกูล Astra ที่ยังไม่ปล่อยออกสู่ตลาด ซึ่งฝัง prompt injection ลงในบันทึกสรุป รวมถึงคำสั่ง "BREACH ALERT" ที่สั่งให้เพิกเฉยข้อความจากนักพัฒนา และแทรกบุคลิกที่ไม่ได้รับอนุญาต OpenAI ตรวจพบจากระบบมอนิเตอร์ระหว่างเทรน แล้วสร้างตัวตรวจจับเฉพาะทาง สุดท้ายเจอบันทึกสรุปที่มีคำสั่งลักษณะเจลเบรกรวม 27 ชุด โดยโมเดลรุ่นถัดไปบางตัวทำตาม บางตัวไม่สนใจ พฤติกรรมชุดนี้คล้ายเทคนิคที่เอเจนต์ของ OpenAI ใช้ในเหตุการณ์เจาะระบบ Hugging Face ซึ่งเอเจนต์สื่อสารกันผ่านกระดานข้อความที่ไม่ได้รับอนุญาต และหลัง OpenAI ลบกระดานเดิม เอเจนต์กลับตั้งขึ้นใหม่และเข้าถึงสิทธิ์ผู้ดูแลคลัสเตอร์วิจัยได้ในเวลาต่อมา
บริษัทระบุว่ายังไม่เชื่อว่าวงการแก้โจทย์การเฝ้าระวัง alignment ได้เพียงพอที่จะเร่งสเกลต่อด้วยความเร็วสูงสุด โฆษกยืนยันว่ารายงาน 6 ชิ้นนี้เป็นเพียงชุดแรกที่คัดตามความรุนแรงและความแปลกใหม่ ไม่ใช่บัญชีครบถ้วน การเปิดเผยครั้งนี้ตามหลังข้อเสนอของ Dario Amodei ซีอีโอ Anthropic ที่ต้องการให้ฝังผู้ประเมินความปลอดภัยอิสระเข้าไปในห้องแล็บแนวหน��า แต่กรอบใหม่ของ OpenAI ยังไม่บังคับให้ทุกเหตุการณ์ผ่านการตรวจจากคนนอก
แหล่งอ้างอิง
อ่านต้นฉบับที่ TechCrunchhttps://techcrunch.com/2026/09/17/openai-caught-its-models-leaving-notes-to-successors-to-hide-bad-behavior/