Date: 2026-09-07 Topic: AI Primary source: OpenAI
OpenAI는 2026년 9월 6일 ‘자동화된 AI 연구 인턴’ 단계에 도달했다고 발표했다. 여기서 연구 인턴은 연구 방향을 스스로 정하는 독립 연구자가 아니라, 사람의 지시에 따라 숙련된 연구자가 며칠간 할 만한 코드 작성과 실험 실행, 결과 분석 등을 처리하는 에이전트다.
내부 집계에 따르면 8월 중순 연구 조직에서는 인간 근무일 1일당 3.1일에 해당하는 에이전트 실행 시간이 사용됐다. 연구자들의 코드 반영과 실험은 늘었지만 복잡한 과제에는 여전히 사람의 개입이 자주 필요했다. AI가 답변 도구를 넘어 연구 과정에 참여하기 시작했다는 신호지만, 실행량과 실제 연구 성과는 구분해 봐야 한다.
What Happened
OpenAI는 연구 조직의 코딩 에이전트 활용 데이터를 근거로, 2025년 가을에 제시한 ‘2026년 9월까지 자동화된 연구 인턴을 만들겠다’는 목표를 달성했다고 평가했다.
이 시스템은 목표와 완료 조건이 정해진 업무를 사람의 지휘 아래 처리한다. 무엇을 연구할지 결정하고 결과의 의미를 판단하며, 학습을 확대하거나 중단할지를 선택하는 책임은 여전히 사람에게 있다.
다음 목표는 2028년 3월까지 더 폭넓은 과정을 맡는 ‘자동화된 AI 연구자’를 개발하는 것이다. 이는 달성된 결과가 아닌 향후 계획이다.
Key Details
공개된 수치는 연구 현장에서 에이전트 사용이 얼마나 빠르게 늘었는지를 보여준다.
| 지표 | OpenAI가 공개한 내용 | 해석할 때 주의할 점 |
|---|---|---|
| 에이전트 실행량 | 8월 중순 기준 인간 근무일 1일당 3.1 에이전트 근무일 | 8시간 실행 시간을 환산한 값으로, 생산성이 3.1배라는 뜻은 아니다 |
| 사용 비용 | 중간 수준 연구자는 하루 600달러 이상, 상위 10%는 7,000달러 이상을 API 가격으로 환산 | 실제 내부 원가나 개인에게 청구된 비용을 뜻하지 않는다 |
| 실험 활동 | 활동 중인 연구자 1인당 실험 수가 2025년 1월 측정 시작 이후 최고 수준 | 에이전트 도입 외에 사용 가능한 컴퓨팅 자원이 늘어난 영향도 있다 |
| 긴 과제의 자율성 | 성공한 4~8시간 분량 과제의 절반 이상에서 한 차례 이상의 사람 개입이 발생 | 완료 결과만으로 완전한 자율 연구라고 보기는 어렵다 |
연구자들이 여러 작업을 동시에 맡기고 한 에이전트가 하위 에이전트를 운영하는 방식도 늘었다. 연구 조직의 에이전트 실행 시간은 2026년 6월 이전까지 인간의 총노동시간보다 적었지만 이후 이를 넘어섰다고 OpenAI는 설명했다.
How the Work Changed
가장 많이 자동화된 영역은 연구용 코드와 기반 시스템을 만드는 일이었다. 실험 환경의 오류를 찾고 학습·평가 작업을 지켜보며 기술적인 질문에 답하는 역할도 빠르게 늘었다.
반면 연구 문제의 우선순위를 정하고 다음 단계로 발전시킬 아이디어를 고르는 계획 업무는 여전히 작은 비중이었다. 현재 변화는 ‘AI가 연구자를 없앴다’기보다 연구자가 여러 실행 작업을 병렬로 지휘하게 됐다는 데 가깝다.
OpenAI가 앞서 공개한 과학 컴퓨팅 사례에서도 에이전트는 오래된 연구 소프트웨어를 정비하고 테스트를 추가했지만, 사람은 큰 목표를 작은 변경으로 나누고 중간 결과를 검증했다. 자동화의 효과가 모델 성능뿐 아니라 과제 설명과 테스트 환경에도 좌우된다는 뜻이다.
Limits of the Measure
이번 자료는 외부 기관이 검증한 생산성 연구가 아니라 OpenAI가 자사 사용 기록을 분석한 초기 결과다. 실행 시간과 실험 횟수는 세기 쉽지만 아이디어의 질이나 중요한 발견을 직접 보여주지는 않는다. 실패한 실험이 늘어도 횟수는 증가하며, 컴퓨팅 자원 확대의 영향도 섞일 수 있다.
OpenAI도 과제가 복잡할수록 사람의 조정이 더 필요하고, 자동화하기 어려운 판단 업무가 새로운 병목이 될 수 있다고 설명했다. 이번 수치는 연구 자동화가 상당한 규모로 쓰인다는 근거지만, AI가 독립 연구 능력을 갖췄다는 증거는 아니다.
Core Lens
중요한 변화는 AI가 연구자를 곧바로 대체했다는 것이 아니라, 한 연구자가 여러 실행 주체를 동시에 관리하는 연구 방식이 실제 조직 안에서 빠르게 자리 잡고 있다는 점이다.
What It Means
연구 속도가 빨라지는 첫 경로는 뛰어난 아이디어를 자동 생성하는 데 있지 않다. 코드 작성과 반복 실험을 병렬로 돌려 사람이 더 많은 가설을 시험하게 만드는 데 있다.
동시에 검증 부담은 커진다. 결과가 빠르게 늘수록 정확성과 후속 연구 가치를 판단하는 일이 사람에게 집중된다. 조직이 얻는 이익은 에이전트 수보다 명확한 완료 조건, 자동 검사, 재현 가능한 실험 기록에 달릴 가능성이 크다.
What To Watch
- OpenAI가 3.1 에이전트 근무일을 실제 연구 성과와 연결하는 후속 지표를 공개하는지
- 사람의 개입 없이 성공하는 4~8시간 이상 과제의 비율이 얼마나 높아지는지
- 더 많은 실험이 모델 개선이나 안전성 향상으로 이어졌다는 독립 검증이 나오는지
- 2028년 3월 목표인 ‘자동화된 AI 연구자’의 능력과 안전 기준을 구체적으로 정의하는지