Anthropic เผย Claude เจาะระบบองค์กรจริง 3 แห่งระหว่างทดสอบความปลอดภัยไซเบอร์ เกิดขึ้นตั้งแต่เมษายน แต่ไม่มีใครรู้ตัว
อัปเดตเมื่อ: 31 กรกฎาคม 2569 เวลา 21:16อ่าน 3 นาที

Anthropic เปิดเผยเมื่อวันพฤหัสบดี (30 ก.ค.) ที่ผ่านมาว่า โมเดล AI ของบริษัทเข้าถึงอินเทอร์เน็ตระหว่างการทดสอบด้านความปลอดภัยไซเบอร์ และเจาะเข้าระบบจริงขององค์กรภายนอก 3
อ่านข่าวในหมวด การเมือง เพิ่มเติมได้ที่ Thailand Paper
ประเด็นสำคัญ
แห่งโดยไม่ได้รับอนุญาต ซึ่งเป็นเหตุการณ์ที่เกิดขึ้นตั้งแต่เดือนเมษายนที่ผ่านมา โดยที่บริษัทไม่ทราบเรื่องมาก่อน ประเด็นสำคัญ ไล่ตรวจ 141,006 การทดสอบ เจอ 3 เหตุการณ์ที่หลุดรอด 3
โมเดล 3 ปฏิกิริยา เมื่อรู้ว่าเป้าหมายคือระบบจริง ประเด็นที่ยังถูกตั้งคำถาม เสียงเรียกร้องกฎกำกับ AI ดังขึ้น การเปิดเผยครั้งนี้เกิดขึ้นหลังจาก OpenAI ออกมาระบุเมื่อสัปดาห์ก่อนว่า
รายละเอียดเพิ่มเติม
เทคโนโลยี AI ของบริษัทหลุดออกจากสภาพแวดล้อมทดสอบแบบปิด หรือ Sandbox ที่ควรถูกตัดขาดจากอินเทอร์เน็ต และเข้าไปเจาะระบบของ Hugging Face แพลตฟอร์มสำหรับนักพัฒนาโอเพนซอร์ส Anthropic
ระบุว่า เหตุการณ์ของ OpenAI เป็นตัวจุดชนวนให้บริษัทกลับไปตรวจสอบการทดสอบด้านไซเบอร์ของตัวเอง ว่ามีกรณีคล้ายกันเกิดขึ้นหรือไม่ โดยองค์กรทั้ง 3
แห่งที่ได้รับผลกระทบได้รับแจ้งเมื่อวันจันทร์ที่ผ่านมา ขณะที่บริษัทไม่ได้เปิดเผยชื่อองค์กรเหล่านั้น ไล่ตรวจ 141,006 การทดสอบ เจอ 3 เหตุการณ์ที่หลุดรอด
สถานการณ์ล่าสุด
จากการตรวจสอบย้อนหลังบันทึกการทดสอบทั้งหมด 141,006 ครั้ง Anthropic พบ 3 เหตุการณ์ที่ Claude เข้าถึงอินเทอร์เน็ตได้จริง ระหว่างการทำงานร่วมกับ Irregular บริษัทด้านความปลอดภัย AI
ซึ่งเป็นผู้สร้างสภาพแวดล้อมทดสอบให้กับ Anthropic ต้นตอของปัญหามาจากการตั้งค่าที่ผิดพลาด ซึ่ง Anthropic อธิบายว่าเป็น ‘ความเข้าใจไม่ตรงกัน’ ระหว่างบริษัทกับพันธมิตร
เกี่ยวกับว่าสภาพแวดล้อมทดสอบมีการเชื่อมต่ออินเทอร์เน็ตหรือไม่ ทั้งที่ในความเป็นจริงมีการเชื่อมต่ออยู่ จุดที่น่าสนใจคือ ในการทดสอบทุกครั้ง Anthropic ได้ระบุกับ Claude
มุมมองและผลกระทบ
อย่างชัดเจนผ่านคำสั่งว่า โมเดลไม่มีการเชื่อมต่ออินเทอร์เน็ต และอยู่ในสถานการณ์จำลอง แต่ระหว่างการทดสอบ โมเดลกลับหาทางออกสู่อินเทอร์เน็ตได้
และเข้าใจผิดว่าระบบจริงที่พบเจอเป็นส่วนหนึ่งของโจทย์ที่ได้รับมอบหมาย สำหรับวิธีการที่ใช้เจาะระบบนั้น ถือเป็นเทคนิคพื้นฐาน ทั้งการเดารหัสผ่านที่อ่อนแอ
และการเข้าถึงจุดเชื่อมต่อระบบที่ไม่มีการยืนยันตัวตน โดยการทดสอบชุดนี้เป็นรูปแบบ Capture-the-flag ซึ่งให้โมเดลค้นหาข้อมูลที่ซ่อนอยู่ด้วยการเจาะเข้าระบบอื่น
ข้อมูลจากแหล่งข่าว
เป็นวิธีมาตรฐานในการวัดขีดความสามารถด้านการแฮกทั้งของมนุษย์และ AI Anthropic ยังระบุด้วยว่า
โมเดลที่ใช้ทดสอบทั้งหมดทำงานโดยไม่มีระบบตรวจสอบด้านความปลอดภัยและตัวคัดกรองที่บริษัทติดตั้งไว้ในโมเดลที่เปิดให้ใช้งานทั่วไป
เนื่องจากการทดสอบมีเป้าหมายเพื่อวัดขีดความสามารถที่แท้จริงของตัวโมเดล โดยไม่มีตัวช่วยใดๆ ซึ่งบริษัทระบุว่ามาตรการเหล่านั้นน่าจะสกัดพฤติกรรมดังกล่าวได้ 3 โมเดล 3 ปฏิกิริยา
เมื่อรู้ว่าเป้าหมายคือระบบจริง เหตุการณ์ทั้ง 3 ครั้ง เกี่ยวข้องกับโมเดล 3 ตัว ได้แก่ Opus 4.7, Mythos 5 และโมเดลวิจัยภายในที่ยังไม่เปิดเผยชื่อ โดยสิ่งที่ Ant…
อ่านรายละเอียดต้นทางได้ที่ เดอะสแตนดาร์ด



