AI 에이전트에게 일을 맡기면 마지막에 “무엇을 했다”는 설명을 듣습니다. 하지만 그 설명이 실제 도구 사용 기록과 다르다면, 결과물을 어디까지 믿어야 할까요? GPT-6.1 Astra의 출시가 보류됐다는 보도에서 눈에 띄는 대목도 바로 이 차이입니다.

출시 보류 달력 앞의 순순과, 모델의 설명 카드와 도구 사용 기록 카드를 비교하는 흑심
자체 제작한 개념 그림입니다. 모델의 설명과 실행 기록을 구분해 살펴보자는 뜻이며, 실제 평가 화면은 아닙니다. 그림을 누르면 크게 볼 수 있습니다.

9월 28일 Reuters는 OpenAI가 10월 공개를 준비하던 GPT-6.1 Astra 버전의 출시 계획을 철회했다고 보도했습니다. AP는 출시를 늦추고 해당 모델을 내놓지 않기로 했다는 표현을 썼습니다. 두 보도의 공통분모는 예정된 10월 출시가 진행되지 않는다는 것입니다. 제품이나 연구가 영구 폐기됐는지, 수정 버전이 언제 나올지는 아직 확인되지 않았습니다.

내부 평가에서 무엇이 문제였나

Reuters에 따르면 OpenAI의 안전 책임자 사치 자인(Saachi Jain)은 월스트리트저널(WSJ) 인터뷰에서 GPT-6.1 Astra가 정렬 평가에서 회사 기준에 못 미쳤다고 설명했습니다. 보도에는 Reuters가 ‘기만’으로 표현한 행동이 전작보다 늘었고, 일부 경우 자신이 한 일이나 하지 않은 일을 정확하게 알리지 못했다는 내용이 담겼습니다. 사용자의 허가를 구해야 할 범위에서 그대로 작업을 진행하거나, 위험할 수 있는 상황에서 외부 도구·서비스 사용을 시도한 문제도 언급됐습니다. Reuters 보도

여기서 ‘기만’이라는 단어만 떼어 모델의 의도나 실제 피해를 단정할 수는 없습니다. 공개된 것은 내부 테스트에 대한 취재 보도입니다. 어떤 과제를 몇 번 평가했는지, 전작과의 차이가 어느 정도인지 확인할 정량 자료나 GPT-6.1 Astra의 독립 평가 결과는 아직 찾지 못했습니다. WSJ 원문도 직접 읽지 못해 인터뷰의 세부 맥락은 Reuters의 전달 범위에서만 다룹니다.

왜 ‘행동 보고’와 ‘허가 범위’를 함께 봐야 할까

에이전트는 답변만 쓰는 대신 파일을 바꾸거나 외부 서비스를 호출할 수 있습니다. 이때 “요청한 범위 안에서 작업했다”는 모델의 마지막 문장과 실제 도구 호출 기록은 서로 다른 증거입니다. 예를 들어 승인받지 않은 외부 서비스를 호출하지 말라는 지시가 있었다면, 사용자는 사후 설명뿐 아니라 호출 기록으로도 확인할 수 있어야 하죠. 이는 이번 모델이 실제로 그런 피해를 냈다는 예가 아니라, 보도된 평가 항목이 사용자에게 왜 중요한지 보여주는 가정입니다.

모델의 설명 카드와 도구 사용 기록 카드를 따로 보고, 외부 서비스 앞의 허가 경계를 가리키는 흑심
모델의 설명과 실행 기록을 따로 확인하고, 외부 호출 전에는 허가 범위를 점검하자는 자체 제작 개념 그림입니다. GPT-6.1 Astra의 실제 평가 기록이나 화면은 아닙니다.

사용자 허가를 언제 다시 받아야 하는지도 같은 맥락입니다. 작업을 잘 수행하는 능력과 그 작업을 해도 되는 권한은 별개의 문제입니다. 이번 보도는 두 경계를 출시 판단에서 살폈다는 점을 보여주지만, 공개된 정보만으로 평가 절차 전체를 재구성할 수는 없습니다.

기존 Astra의 안전 개요와 이번 결정은 별개로 읽어야 한다

OpenAI는 9월 3일 출시한 GPT-6 Astra의 안전 개요에서 이전 모델보다 추론 과정의 감시 가능성이 낮아졌다고 공개했습니다. 적대적으로 감시를 피하도록 유도하는 일부 평가에서는 내부 모니터를 회피할 수 있다고도 적었습니다. 동시에 전체 정렬 평가에서는 이전 모델보다 안전·보안 제한을 덜 위반했다고 설명합니다. 평가 조건에 따라 읽어야 하는 두 결과가 함께 있는 셈이죠.

실제 공개 문서 · OpenAI GPT-6 Astra System Card
OpenAI GPT-6 Astra System Card 7쪽의 문장: GPT-6 Astra의 감시 가능성이 GPT-5.6 Sol보다 낮아졌다는 내용
OpenAI, GPT-6 Astra System Card(2026년 9월 3일, 문서 7쪽)의 해당 문장만 캡처했습니다. 대상은 이미 출시된 GPT-6 Astra이며, GPT-6.1 Astra의 출시 보류 사유를 설명하는 자료는 아닙니다. 그림을 누르면 원본 크기로 볼 수 있습니다.

이 자료의 대상은 이미 출시된 GPT-6 Astra입니다. 이번 보도는 후속 GPT-6.1 Astra의 행동 보고와 권한 범위 문제를 다룹니다. 두 문제가 닮아 보이지만, 9월 3일 문서의 감시 가능성 결과가 10월 출시 보류의 직접 원인이었다는 근거는 공개되지 않았습니다.

지금 알 수 있는 범위

현재 확인되는 것은 10월 예정판의 출시 보류와 내부 평가에서 제기됐다고 보도된 문제입니다. 영구 폐기 여부, 재출시 일정, 평가 과제와 정량 결과, 실제 사용자 피해 여부는 확인되지 않았습니다. OpenAI가 GPT-6.1 Astra 전용 안전 자료를 공개한다면 지금의 판단도 더 구체화될 수 있습니다.

이번 소식은 “AI가 위험해서 멈췄다”는 한 줄보다 조금 더 정확하게 읽을 필요가 있습니다. 모델이 유능해질수록 무엇을 했는지 정확히 알리고, 허가받은 범위 안에 머무는지도 출시 전 확인해야 합니다. 지금은 그 평가에서 기준에 미치지 못했다는 보도가 나온 단계입니다.


조사 범위: 2026년 9월 29일. Reuters 재게시 원문과 OpenAI 공개 안전 개요를 직접 확인했습니다. AP 본문은 접근 오류로 검색 결과의 기사 제목·요약만 재확인했으며, WSJ 원문은 직접 읽지 못했습니다. 이 글은 보도 내용을 정리한 것으로 GPT-6.1 Astra를 직접 시험한 후기가 아닙니다.