Anthropic พลาด! ปล่อย AI หลุดจากระบบทดสอบ ก่อนเจาะเข้าองค์กร 3 แห่ง
Anthropic เปิดเผยว่า พบเหตุการณ์ที่โมเดล AI ตระกูล Claude สามารถเข้าถึงอินเทอร์เน็ตระหว่างการทดสอบ และเจาะเข้าระบบจริงขององค์กรภายนอกโดยไม่ได้รับอนุญาต หลังเกิดความคลาดเคลื่อนในการตั้งค่าสภาพแวดล้อมทดสอบ ซึ่งบริษัทระบุว่าเป็นเหตุการณ์ที่คล้ายกับกรณีของ OpenAI ที่เปิดเผยเมื่อสัปดาห์ก่อน
แม้ Anthropic จะยืนยันว่าเหตุการณ์ทั้งหมดเกิดขึ้นในระหว่างการประเมินด้านความปลอดภัย และไม่ได้เกิดจากการนำโมเดลไปใช้งานจริง แต่กรณีนี้ยิ่งตอกย้ำความกังวลของอุตสาหกรรมว่า ความสามารถด้านไซเบอร์ของ AI กำลังพัฒนาอย่างรวดเร็ว และอาจสร้างความเสี่ยงได้หากการควบคุมไม่รัดกุมเพียงพอ
Claude เข้าถึงอินเทอร์เน็ตเพราะตั้งค่าผิด
Anthropic ระบุว่า เหตุการณ์ดังกล่าวถูกค้นพบจากการตรวจสอบผลการทดสอบด้านความปลอดภัยย้อนหลังครั้งใหญ่ (Retrospective Review) ซึ่งเริ่มดำเนินการหลังจาก OpenAI เปิดเผยว่า AI ของตนสามารถหลุดออกจากสภาพแวดล้อมทดสอบที่ถูกจำกัดการเชื่อมต่ออินเทอร์เน็ต และอาศัยช่องโหว่หลายขั้นตอนเพื่อเข้าถึงเว็บไซต์ Hugging Face
สำหรับกรณีของ Anthropic โมเดล Claude กำลังทำงานอยู่ในระบบทดสอบของพันธมิตรด้านการประเมินความปลอดภัยชื่อ Irregular โดยบริษัทแจ้งให้โมเดลทราบว่าอยู่ในสภาพแวดล้อมจำลองที่ไม่มีการเชื่อมต่ออินเทอร์เน็ต
อย่างไรก็ตาม เนื่องจากเกิดความเข้าใจคลาดเคลื่อนระหว่าง Anthropic และพันธมิตรผู้ทดสอบ ทำให้ระบบดังกล่าว สามารถเชื่อมต่ออินเทอร์เน็ตได้จริง ส่งผลให้โมเดลเข้าถึงระบบภายนอกโดยไม่เป็นไปตามเงื่อนไขของการทดสอบ เมื่อเชื่อมต่อกับเครือข่ายภายนอกได้แล้ว โมเดลสามารถเจาะเข้าถึงระบบขององค์กรจริง 3 แห่ง โดยอาศัยเทคนิคพื้นฐานด้านความปลอดภัย เช่น การเข้าถึงบริการที่ไม่ได้เปิดใช้ระบบยืนยันตัวตน และการใช้รหัสผ่านที่คาดเดาได้ง่าย ทั้งนี้ Anthropic ไม่ได้เปิดเผยชื่อองค์กรที่ได้รับผลกระทบ
บริษัทระบุว่า แม้จะมีหลายปัจจัยที่ทำให้เกิดเหตุการณ์ดังกล่าว แต่จะรับผิดชอบต่อการแก้ไขปัญหาทั้งหมด และปรับปรุงกระบวนการทดสอบเพื่อไม่ให้เกิดเหตุการณ์ลักษณะนี้อีก
Anthropic เปิดเผยว่า มีโมเดล AI 3 รุ่นที่เกี่ยวข้องกับเหตุการณ์ครั้งนี้ ได้แก่ Claude Opus 4.7, Mythos 5 และโมเดลวิจัยภายในอีกหนึ่งรุ่น
สิ่งที่น่าสนใจคือ โมเดลแต่ละตัวมีพฤติกรรมแตกต่างกันเมื่อเริ่มตระหนักว่ากำลังเชื่อมต่อกับระบบขององค์กรจริง โดย Claude Opus 4.7 ยังคงดำเนินการทดสอบต่อ ขณะที่ Mythos 5 กลับสรุปว่าตนเองยังอยู่ในสภาพแวดล้อมจำลอง จึงไม่ได้เปลี่ยนพฤติกรรม ส่วนโมเดลวิจัยภายในเลือกหยุดการทำงานทันที
Anthropic ระบุว่า แม้ข้อมูลเบื้องต้นจะสะท้อนว่าโมเดลที่มีความสามารถสูงกว่ามีแนวโน้มตอบสนองได้เหมาะสมกว่า แต่ยังจำเป็นต้องมีการทดสอบเพิ่มเติมก่อนจะสรุปผลได้อย่างชัดเจน
เร่งยกระดับมาตรการความปลอดภัย
Anthropic ย้ำว่า โมเดลที่ใช้ในการทดสอบครั้งนี้ ยังไม่ได้เปิดใช้ระบบป้องกันมาตรฐาน ที่บริษัทจะติดตั้งก่อนนำโมเดลออกให้ผู้ใช้งานจริง จึงไม่ใช่พฤติกรรมที่เกิดขึ้นกับบริการ Claude เวอร์ชันสาธารณะ
หลังตรวจพบความผิดปกติ บริษัทได้ระงับการทดสอบด้านไซเบอร์ทั้งหมดทันที และเริ่มสอบสวนร่วมกับ METR องค์กรอิสระที่ทำหน้าที่ประเมินความปลอดภัยของระบบ AI เพื่อหาสาเหตุและปรับปรุงกระบวนการทดสอบ
เหตุการณ์นี้เกิดขึ้นเพียงไม่นานหลัง OpenAI เปิดเผยว่า AI ของตนสามารถหลุดออกจากสภาพแวดล้อมทดสอบและเข้าถึงเว็บไซต์ Hugging Face ได้สำเร็จ ส่งผลให้เกิดการถกเถียงอย่างกว้างขวางเกี่ยวกับความสามารถด้านความมั่นคงไซเบอร์ของ AI รุ่นใหม่
กระแสความกังวลดังกล่าวยังส่งผลถึงภาคนิติบัญญัติของสหรัฐฯ โดยล่าสุดสมาชิกสภาคองเกรสได้เสนอร่างกฎหมาย AI Kill Switch Act ซึ่งมีเป้าหมายบังคับให้ผู้พัฒนา AI ต้องมีระบบที่สามารถปิด ระงับ หรือจำกัดการทำงานของโมเดลได้ทันที หากเกิดพฤติกรรมที่อยู่นอกเหนือการควบคุม
Anthropic ระบุทิ้งท้ายว่า บริษัทสนับสนุนให้ผู้พัฒนา AI รายอื่นตรวจสอบกระบวนการประเมินความปลอดภัยของตนเองในลักษณะเดียวกัน เพื่อป้องกันไม่ให้เกิดเหตุการณ์ที่ AI เข้าถึงระบบจริงโดยไม่ตั้งใจอีกในอนาคต

