AI 코딩 도구의 신뢰 격차
- •TheBitForge는 AI가 보일러플레이트, CRUD 스캐폴딩, 반복 테스트, 문서화, 초안 작성에 강하다고 평가했다
- •2025년 METR 연구는 AI 보조 개발자가 20% 더 빠르다고 느끼면서도 실제로는 19% 더 오래 걸렸다고 밝혔다
- •수동적 수용은 이해도 50% 대 67%라는 17포인트 격차를 만들었다고 분석했다
TheBitForge는 2026년 9월 14일 AI 코딩 도구가 좁은 프로그래밍 작업에서는 개발자보다 나은 성과를 낼 수 있지만, 팀이 생성된 코드를 이해되고 테스트된 소프트웨어처럼 다루면 심각한 위험이 생긴다고 주장했다. 저자는 “Claude가 그냥 할 수 있다”며 주니어 개발자 채용을 건너뛰려던 고객, 2027년까지 자신의 일이 사라질 것으로 본 지인, 겉보기에는 맞았지만 “조용히 망가져 있던” AI 생성 pull request 등 최근 논쟁 3가지를 근거로 들었다.
저자에 따르면 dev.to에서 AI가 이미 대부분의 소프트웨어 개발자보다 코딩을 더 잘한다는 글은 며칠 만에 190+개 반응과 150+개 댓글을 얻었다. TheBitForge는 이 주장이 “절반만 맞다”고 했다. AI는 보일러플레이트, CRUD 스캐폴딩(기본 생성·조회·수정·삭제 앱 코드), 설정 파일, 반복적인 단위 테스트, 문서화, 복잡한 API 시그니처, 언어 간 로직 변환, 잘 알려진 구조의 초안 작성에 강하다는 설명이다.
저자는 AI가 좁고 검증하기 쉬운 작업에서 가장 잘 작동한다고 봤으며, 고객 업무에서 WooCommerce hook 시그니처를 “2초 만에” 생성한 사례를 들었다. 다만 이런 실무 생산성은 AI가 개발자의 전체 역할을 대체할 수 있다는 주장과 구분된다고 했다. 빠른 문법 생성은 신뢰할 수 있는 소프트웨어 배포와 같지 않다는 것이다.
2025년 METR 연구에서는 경험 있는 개발자들이 실제 작업에서 frontier AI 도구를 썼을 때 완료 시간이 19% 더 길어졌지만 체감상으로는 20% 더 빠르다고 느낀 것으로 나타났다. 또한 AI 생성 코드는 사람이 작성한 코드보다 버그를 도입할 가능성이 약 1.7x 높고, 공격자가 페이지에 스크립트를 주입하는 웹 보안 결함인 XSS 취약점을 도입할 가능성은 거의 2.7x 높다는 주장도 인용됐다.
TheBitForge는 위험이 눈에 띄는 문법 오류가 아니라 off-by-one 실수, 놓친 edge case, 배포 3주 뒤 부하 상황에서 드러날 수 있는 race condition 같은 미묘한 실패라고 했다. 개발자 중 AI 출력물을 확인 없이 신뢰하는 비율은 3.1%에 그쳤고, 45.2%는 AI 생성 코드를 디버깅하는 시간이 직접 작성하는 것보다 더 오래 걸린다고 답했다.
저자는 개발자가 더 이상 완전히 이해하지 못하는 코드를 검토하다가 결국 생성된 작업을 형식적으로 승인하는 패턴을 “이해 부채”라고 표현했다. 2026년 1월 연구는 그 비용을 수치화했다. AI 생성 코드를 수동적으로 받아들인 개발자는 이해도 테스트에서 50%를 기록한 반면, 손으로 코드를 작성한 개발자는 67%를 기록해 17포인트 격차가 났다.
TheBitForge는 AI가 문법을 빠르게 입력하는 일에서는 인간보다 낫지만, IDC 데이터상 코드 작성은 개발자 하루의 약 16%에 불과하다고 했다. 저자에 따르면 나머지 84%는 불명확한 요구사항, 문서화되지 않은 trade-off, 18개월 뒤 중요해지는 아키텍처 결정, AI 도구가 갖지 못한 비즈니스 맥락 지식으로 채워진다.
TheBitForge는 개발자에게 AI 출력물을 꼼꼼히 읽고, 이해를 유지하기 위해 일부 코드는 직접 작성하며, AI를 자신의 사고를 검증하는 도구로 쓰라고 조언했다. 또한 “작동한다”는 말은 검토의 끝이 아니라 시작점으로 봐야 한다고 했다. 특히 인증, 결제, 사용자 데이터는 인용된 2.7x XSS 취약점 위험이 가장 중요한 영역으로 지목됐다.