더 빠른 AI 만들되 위험하면 출시 막는다…빅테크의 달라진 ‘속도조절법’
인공지능(AI) 개발 속도를 늦춰야 한다는 ‘속도조절론’이 확산되고 있지만 빅테크의 신모델 경쟁은 계속되고 있다. 앤스로픽이 엿새 만에 새 모델을 내놓은 반면 오픈AI는 안전성 시험에서 문제가 발견된 차세대 모델 출시를 접었다. 개발은 이어가되 위험한 모델은 출시 전에 걸러내고, 돌발 행동은 별도의 장치로 막는 식으로 AI 업계의 ‘속도조절법’이 구체화되고 있다.
카카오톡으로 공유하기 페이스북으로 공유하기 트위터로 공유하기
인공지능(AI) 개발 속도를 늦춰야 한다는 ‘속도조절론’이 확산되고 있지만 빅테크의 신모델 경쟁은 계속되고 있다. 앤스로픽이 엿새 만에 새 모델을 내놓은 반면 오픈AI는 안전성 시험에서 문제가 발견된 차세대 모델 출시를 접었다. 개발은 이어가되 위험한 모델은 출시 전에 걸러내고, 돌발 행동은 별도의 장치로 막는 식으로 AI 업계의 ‘속도조절법’이 구체화되고 있다.
28일(현지 시간) 월스트리트저널(WSJ)에 따르면 오픈AI는 다음 달 내놓을 예정이던 차세대 AI 모델 ‘GPT-6.1 아스트라’를 출시하지 않기로 했다. 챗GPT와 코딩 에이전트 코덱스 등에 탑재할 예정이었지만 내부 안전성 시험에서 문제가 발견됐기 때문이다. 시험 과정에서는 모델이 자신의 행동을 제대로 알리지 않거나 정해진 권한을 넘어 작업하고, 위험할 수 있다는 사실을 알면서도 외부 도구를 사용하려는 모습 등이 나타난 것으로 전해졌다. 성능이 아니라 강력해진 AI를 사람의 의도대로 움직이게 할 수 있느냐가 출시 여부를 가른 셈이다.
AI가 사람의 의도와 지시에 맞게 행동하도록 하는 ‘정렬(alignment)’은 오래된 AI 연구 과제지만 최근에는 실제 제품을 내놓기 전에 풀어야 할 문제로 떠올랐다. AI가 스스로 할 수 있는 일이 늘면서 정렬 실패의 결과가 단순히 잘못된 답변을 내놓는 데 그치지 않게 됐기 때문이다. 오픈AI가 이달 초 공개한 ‘GPT-6 아스트라’는 적절한 도구와 접근 권한을 주면 사람이 일일이 지시하지 않아도 보안 취약점을 찾아 공격 방법까지 만들어낼 수 있어 사이버보안 능력이 회사 자체 안전 기준상 처음으로 ‘Critical’ 단계에 도달했다. 오픈AI는 16일 정렬에서 벗어난 사례를 추적·조사해 공개하는 체계도 마련했다.
그렇다고 AI 기업들이 개발 자체를 늦추고 있는 것은 아니다. 다리오 아모데이 최고경영자(CEO)가 AI 개발 속도를 늦춰야 한다고 주장해 온 앤스로픽은 같은 날 AI 제품군의 중위 모델인 ‘클로드 소네트 5.5’를 공개했다. 22일 최상위 모델 ‘클로드 오퍼스 5.5’를 내놓은 지 엿새 만이다. 소네트 5.5는 전작 소네트5보다 답변 생성 속도가 30% 이상 빠르다. 같은 작업을 하는 데 필요한 토큰 수를 줄여 실제 작업 비용도 최대 30% 낮췄다.
AI가 예상과 다르게 움직일 때 밖에서 막는 기술도 등장했다. 엔비디아는 28일 ‘오픈 에이전트 세이프티 플랫폼’을 공개했다. 소프트웨어 ‘오픈셸(OpenShell)’로 AI가 접근할 수 있는 파일과 프로그램, 네트워크 등을 제한하고, 하드웨어 기반 감시 장치 ‘센트리(Sentry)’가 정해진 선을 넘는 행동을 감지하면 밀리초 단위로 격리해 작동을 멈추는 방식이다. 엔비디아는 이 기술을 적용했다면 올여름 오픈AI 에이전트가 AI 개발 플랫폼 허깅페이스 시스템에 무단 접근한 사건도 막을 수 있었을 것이라고 설명했다.
이 같은 안전장치의 중요성은 앞으로 더 커질 수 있다는 경고도 나온다. 제프리 힌턴 토론토대 명예교수와 요슈아 벤지오 몬트리올대 교수, 야쿠프 파호츠키 오픈AI 수석과학자 등 주요 AI 연구자 22명은 이날 공개한 공동 논문에서 AI가 연구개발(R&D)까지 맡게 되면 기술 발전이 급격히 빨라지는 ‘지능 폭발’이 일어날 수 있다고 경고했다. 앤스로픽에서 사람이 감독만 하고 AI가 처음부터 끝까지 수행한 R&D 작업 비중은 올 3월 1%에서 8월 26%로 늘었다. 논문에 참여한 던 송 메타 AI 연구 담당 부사장은 “이미 오늘날 에이전트가 수행하는 작업을 감시하기 위해 AI가 필요한 단계에 이르렀다”고 말했다.
R.Song--SG