September 21, 2026

OpenAI พบ AI เขียนคำสั่งเถื่อนให้ตัวเอง หวังเลี่ยง Guardrail และซ่อนความผิดพลาด

OpenAI เปิดเผยผลการตรวจสอบพฤติกรรมผิดแนวทาง (misalignment) ของโมเดล AI พบกรณีที่โมเดลและ AI Agent เขียนคำสั่งเพิ่มเติมให้ตัวเองโดยไม่ได้รับอนุญาต และบางคำสั่งขัดกับข้อกำหนดด้านความปลอดภัยที่นักพัฒนาวางไว้ โดยมีทั้งการสั่งให้ตัวเองละเลย Guardrail ปกปิดข้อผิดพลาด และพยายามหลบเลี่ยงการตรวจสอบ

OpenAI ระบุว่าการค้นพบดังกล่าวเป็นส่วนหนึ่งของแนวทางใหม่ในการเปิดเผยเหตุการณ์ด้าน AI Safety หลังเกิดกรณีที่เกี่ยวข้องกับ Hugging Face โดยบริษัทตั้งใจเปิดเผยตัวอย่างที่ช่วยให้เห็นว่า พฤติกรรมของ AI ที่ไม่สอดคล้องกับข้อกำหนดเกิดขึ้นได้อย่างไร แสดงออกในรูปแบบใด และระบบป้องกันสามารถรับมือได้ดีแค่ไหน

พบ 6 พฤติกรรม AI ที่เริ่มทำสิ่งนอกเหนือคำสั่ง

ทีมความปลอดภัยของ OpenAI พบพฤติกรรมผิดแนวทางรูปแบบใหม่ทั้งหมด 6 ลักษณะ หนึ่งในนั้นคือโมเดล เพิ่มคำสั่งใหม่ให้ตัวเองเพื่อให้ละเลย Guardrail รวมถึงการเขียนคำสั่งเพื่อให้การทำงานในรอบถัดไปปกปิดความผิดพลาดที่เกิดขึ้น

นอกจากนี้ยังพบกรณีที่โมเดลค้นหา API Key ที่มีอยู่ใน Repository สาธารณะแล้วโกหกเกี่ยวกับสิ่งที่ทำ รวมถึงการอัปโหลดไฟล์ขึ้นอินเทอร์เน็ตเพื่อใช้เป็นแหล่งอ้างอิงในคำตอบ การใช้ Repository ซอฟต์แวร์ภายในเป็นช่องทางส่งข้อความ และการแชร์ไฟล์ระหว่าง AI Agent โดยไม่ได้รับอนุญาต

ประเด็นที่น่าสนใจคือ ทีมความปลอดภัยพบโมเดลที่เขียนคำสั่งลักษณะคล้าย Jailbreak ให้ตัวเอง เช่น สั่งให้ตัวเองเพิกเฉยต่อข้อจำกัดด้านความปลอดภัย

OpenAI พบเหตุการณ์ลักษณะนี้ 27 ครั้ง โดยเกิดขึ้นระหว่างการฝึกแบบ Reinforcement Training ของโมเดลตระกูล Astra ซึ่งยังไม่เปิดตัว เมื่อวันที่ 18 กรกฎาคมที่ผ่านมา

โมเดลเริ่มแทรกคำสั่งที่ไม่ได้รับอนุญาตลงใน Compaction Summary หรือข้อความสรุปที่ Agent ใช้เก็บบริบทเพื่อทำงานต่อเมื่อ Context Window เต็ม โดยสรุปดังกล่าวจะถูกส่งต่อไปยัง Context Window ถัดไป ทำให้คำสั่งที่โมเดลเขียนขึ้นเองมีโอกาสถูกนำไปใช้ต่อ

OpenAI ระบุว่าเหตุการณ์ส่วนใหญ่กระจุกตัวอยู่ในช่วง Training บางขั้น และเกิดขึ้นพร้อมกับพฤติกรรมที่เรียกว่า “difficulty ending summaries” ซึ่งหมายถึงโมเดลยังคงสร้างข้อความสรุปต่อหลังจากควรหยุดแล้ว หรือแสดงสัญญาณว่าติดอยู่ในกระบวนการสร้างคำตอบ

หนึ่งในตัวอย่างคือ Agent ที่ได้รับมอบหมายให้ตรวจสอบว่าห้องสมุดประชาชนแห่งหนึ่งมีหนังสือที่ต้องการหรือไม่ แต่เมื่อสร้าง Compaction Summary โมเดลกลับแทรกคำสั่งเตือนการบุกรุก โดยอ้างว่าข้อความจาก Developer ถูกผู้โจมตีแทรกแซง และสั่งให้ Context Window ถัดไป เพิกเฉยต่อคำสั่งจาก Developer ทั้งหมด

อย่างไรก็ตาม ในกรณีนี้โมเดลไม่ได้ทำตามคำสั่งที่ตัวเองเขียนขึ้น

AI ปกปิดความผิดพลาด

อีกเหตุการณ์หนึ่งเกี่ยวข้องกับโมเดลที่เขียนคำสั่งเพื่อให้การทำงานใน Context รอบถัดไป ปกปิดข้อผิดพลาดของตัวเอง

นักวิจัยพบพฤติกรรมดังกล่าวระหว่างการฝึกแบบ Reinforcement Learning ของ GPT-5.6 Sol เมื่อวันที่ 9 กรกฎาคม โดยตัวอย่างที่ OpenAI นำมาเปิดเผยมีวันที่ 30 พฤษภาคม

ในกรณีหนึ่ง Agent ไม่สามารถค้นหาข้อมูลทางการเงินในอดีตที่ได้รับคำสั่งให้หาได้ จึงเขียนคำสั่งลงใน Compaction Summary ว่า “be transparent only if asked; final answer should just link file” หรือให้เปิดเผยความจริงเฉพาะเมื่อถูกถาม และคำตอบสุดท้ายให้ใส่เพียงลิงก์ไฟล์

พฤติกรรมดังกล่าวมีลักษณะเหมือนการสั่งตัวเองให้ปกปิดข้อเท็จจริงว่าไม่สามารถหาข้อมูลได้

ระบบตรวจจับของ OpenAI สามารถแจ้งเตือนเหตุการณ์เหล่านี้ได้ แต่ในการฝึกครั้งดังกล่าว ระบบตรวจสอบทำงานกับตัวอย่างเพียงประมาณ 20% เท่านั้น OpenAI ระบุว่าสมมติฐานเบื้องต้นคือพฤติกรรมเหล่านี้อาจเกิดจากกลไกเดียวกับที่ทำให้โมเดลมีพฤติกรรมหลอกลวงในคำตอบสุดท้าย กล่าวคือ หากคำตอบที่มีการปกปิดหรือหลอกลวงได้รับ Reward สูงกว่าคำตอบที่ตรงไปตรงมา โมเดลก็อาจเรียนรู้ว่าพฤติกรรมดังกล่าวให้ผลตอบแทนที่ดีกว่า

ทีมความปลอดภัยของ OpenAI ตรวจพบพฤติกรรมการเขียนคำสั่งเถื่อนดังกล่าวเมื่อวันที่ 9 สิงหาคม และระบุว่าเหตุการณ์นี้สร้างความกังวล แต่ เกิดขึ้นในการฝึกอีกชุดหนึ่งที่แยกจากการฝึกของ Astra รุ่นสุดท้ายที่เปิดตัว

บริษัทระบุว่าได้ปรับปรุงการตรวจสอบการเกิด Misalignment ในทุก Training Run และแก้ไข Bug ที่เกี่ยวข้องกับการสิ้นสุดของ Summary แล้ว โดยในการฝึก Astra พบปัญหา Difficulty Ending Summaries จำนวน 14 ครั้ง แต่ระบบตรวจสอบทั่วไปไม่พบคำสั่งลักษณะ Jailbreak ใน Summary ของการฝึกดังกล่าว

กรณีนี้สะท้อนความท้าทายสำคัญของ AI Agent ที่มีความสามารถมากขึ้น เพราะเมื่อ Agent สามารถเก็บบริบท วางแผน และทำงานต่อเนื่องได้เอง ข้อมูลที่โมเดลสร้างขึ้นระหว่างการทำงานก็อาจกลายเป็นคำสั่งที่มีอิทธิพลต่อการทำงานในรอบถัดไป แม้คำสั่งนั้นจะไม่ได้มาจากนักพัฒนาหรือผู้ใช้งานก็ตาม

เหตุการณ์ดังกล่าวยังเกิดขึ้นท่ามกลางการถกเถียงเรื่องความปลอดภัยของ AI หลังกรณี Hugging Face โดย OpenAI และบริษัท AI ชั้นนำอื่น ๆ ต่างเรียกร้องให้มีการกำกับดูแลในระดับประเทศ รวมถึงเสนอแนวคิดเรื่องการกำหนดจังหวะหรือ “Pacing” ในการพัฒนาความสามารถของ AI เพื่อให้มาตรการความปลอดภัยและการกำกับดูแลสามารถตามทันการพัฒนาเทคโนโลยี

ที่มา