AI 코딩 에이전트는 코드를 더 많이 만들지만 소프트웨어는 늘리지 못한다
하버드 연구진 Fiona Chen과 James Stratton은 Jellyfish가 집계한 약 3억 건의 작업 이벤트, 700여 개 기업의 직원 70만 명 이상 데이터를 2021년부터 2026년 3월까지 분석했다. 코딩 효율 향상은 길어진 코드 리뷰에 흡수되어 소프트웨어 산출과 고용에는 뚜렷한 변화가 없었다.
업계는 오랫동안 단순한 가정 위에서 움직여 왔다. AI 코딩 어시스턴트와 에이전트가 코드를 더 빨리 쓰면 소프트웨어 산출도 그에 비례해 늘 것이고, 기업은 엔지니어 수까지 줄일 수 있다는 가정이다. Ars Technica가 보도한 새 연구는 이 가정에 정면으로 의문을 제기한다. 하버드대학교의 Fiona Chen과 James Stratton은 수백 개 기업의 실제 엔지니어링 데이터를 분석했고, 이런 도구를 도입한 기업이 소프트웨어 산출을 늘렸거나 고용을 줄였다는 증거는 거의 없다고 결론지었다. 코드는 분명히 더 싸게 만들어진다. 그러나 출시되는 소프트웨어는 늘지 않았다.
연구의 데이터 기반은 탄탄하다. 저자들은 엔지니어링 팀의 세부 산출을 측정하는 Jellyfish가 집계한 분석 데이터를 사용했다. 커밋과 풀 리퀘스트 같은 약 3억 건의 개별 작업 이벤트와 이슈 관리 소프트웨어 기록을 포함하며, 2021년부터 2026년 3월까지 700곳이 넘는 소프트웨어 개발 기업의 직원 70만 명 이상을 다룬다. 각 기업이 언제 AI를 도입했는지는 직접 측정한 AI 사용량과 GitHub 활동 분석을 결합해 판단했다. 또한 사람이 주로 작성한 코드를 자동 완성해 주는 AI 코딩 어시스턴트와, 프롬프트에 따라 스스로 코드를 작성하고 제출하는 AI 코딩 에이전트를 구분했다. 그런 다음 도입 전후의 핵심 변수에 대해 이중차분 회귀를 적용했다. 이 설계는 전반적인 시간 추세와 기업 간 고정된 차이를 도구 자체의 효과와 분리해 주므로, 사용자와 비사용자를 단순 비교하는 것보다 인과적 해석에 가깝다.
가장 눈여겨볼 대목은 원인에 대한 설명이다. 저자들에 따르면 코딩 단계에서 얻은 효율 향상은 생산 과정 하류의 제약에 흡수되며, 그중 가장 큰 제약이 사람의 코드 리뷰다. AI 도입 이후 코드 리뷰에 걸리는 시간이 크게 늘었고, 풀 리퀘스트가 수정을 요구받을 가능성이 높아졌으며, 리뷰어가 남기는 댓글도 많아졌다. 현업 개발자라면 누구나 공감할 패턴이다. AI가 만든 코드는 그럴듯해 보이고 실제로 돌아가는 경우도 많지만, 검토 없이 믿을 수는 없다. 그래서 정확성을 확인하는 비용이 작성자에게서 리뷰어에게로 넘어간다. 공정의 한 단계가 빨라져도 이웃 단계가 그대로라면 전체 처리량은 가장 느린 단계가 결정한다. 제약이론의 오래된 논리이며, 달라진 점은 병목이 「쓰기」에서 「읽기」로 옮겨왔다는 것뿐이다.
업계에는 몇 가지 시사점이 있다. 첫째, 생성된 코드 줄 수, 커밋 수, 도구 도입률 같은 지표는 오해를 부르기 쉽다. 이 지표들은 도구가 증폭하는 쪽에 있어서, 실제 출시가 달라지지 않아도 인상적으로 보인다. 둘째, 생산성 이득을 실제로 거두려는 기업은 더 강력한 생성 도구를 사는 데서 멈춰서는 안 된다. 자동화된 테스트, 정적 분석, 지킬 수 있는 규약, 그리고 생성만이 아니라 검증을 돕는 에이전트 같은 리뷰 단계에 대한 투자가 필요하다. 셋째, AI 덕분에 개발 조직을 줄일 수 있다는 서사는 이 데이터로는 뒷받침되지 않는다. 연구 기간 내에 고용이 뚜렷하게 감소한 흔적은 없었다. 다만 이 말의 범위는 분명히 해야 한다. 연구는 AI에 가치가 없다고 말하지 않는다. 기업 수준의 산출과 인력 지표에 눈에 띄는 변화가 없다고 말할 뿐이며, 이는 개별 작업이 빨라지지 않는다는 주장과는 다르다.
이 연구에도 한계가 있다. 데이터는 2026년 3월에서 끝나는데, 모델 성능과 에이전트 설계, 팀의 작업 방식은 빠르게 변하고 있다. 리뷰 병목이 영구적이라는 보장은 없다. 앞으로의 에이전트가 더 작고 검증하기 쉬운 변경을 내놓거나, 리뷰어가 빠르게 확인할 수 있는 테스트와 근거를 함께 제출한다면 리뷰 비용은 내려갈 수 있다. 또한 소프트웨어 산출 자체가 측정하기 어렵고, 커밋과 풀 리퀘스트는 사용자에게 전달된 가치의 대리 지표일 뿐이다. 그래도 메시지는 분명하다. 에이전트 시대에 희소한 능력은 더 이상 코드를 쓰는 능력이 아니라, 받아들일 수 있는 비용으로 코드가 올바른지 확인하는 능력이다. 검증을 더 빠르고 믿을 만하게 만드는 팀과 도구가 더 많은 코드를 더 많은 소프트웨어로 바꿀 가능성이 가장 높다.
Sources
FAQ
이 연구의 핵심 결론은 무엇인가요?
하버드의 Fiona Chen과 James Stratton은 AI 코딩 어시스턴트나 에이전트를 도입한 기업이 소프트웨어 산출을 늘리거나 고용을 줄였다는 증거가 거의 없다고 밝혔습니다. 코딩 단계의 효율 향상은 주로 사람의 코드 리뷰라는 하류 제약에 흡수됩니다.
왜 코드 리뷰가 병목이 되나요?
AI 도입 후 리뷰 시간이 크게 늘고, 풀 리퀘스트가 수정을 요구받는 경우가 잦아지며, 리뷰어의 댓글도 많아졌습니다. AI 코드는 검토 없이 믿을 수 없으므로 정확성 확인 비용이 작성자에서 리뷰어로 이동합니다.
데이터와 방법은 얼마나 믿을 만한가요?
Jellyfish 데이터는 약 3억 건의 작업 이벤트, 700여 개 기업, 직원 70만 명 이상을 2021년부터 2026년 3월까지 다룹니다. 방법은 이중차분 회귀입니다. 한계는 데이터가 2026년 3월에서 끝나고 커밋과 풀 리퀘스트가 산출의 대리 지표일 뿐이라는 점입니다.