코딩 에이전트 파일 감사 필요
- •오스마니는 CLAUDE.md, AGENTS.md, skills, hooks, memory, MCP servers, plugins의 정기 감사를 촉구했다
- •6월 100개 저장소 연구에서 lint leakage 62%, context bloat 42%, skill leakage 35%가 발견됐다
- •Context files는 실제 코딩 작업 17개, 288회 실행에서 명확한 correctness gain을 보이지 않았다
애디 오스마니(Addy Osmani)는 CLAUDE.md, AGENTS.md, skills, hooks, memory, MCP servers, plugins 같은 코딩 에이전트 설정 파일을 감사하라고 개발자들에게 촉구했다. 모델 동작, 에이전트 하니스, 코드베이스가 시간이 지나며 바뀌기 때문이다. 그는 오래된 모델을 기준으로 쓴 지시문이 낡아질 수 있고, 팀이 규칙을 제거하거나 테스트하지 않은 채 계속 추가하면 토큰 비용이 늘며 에이전트 성능도 나빠질 수 있다고 말했다.
오스마니는 많은 개발자가 CLAUDE.md와 AGENTS.md를 공식 200-line 목표 안에 유지하려 하지만 파일이 커지면서 어려움을 겪는다고 말했다. 그는 사용자가 몇 달마다 CLAUDE.md, skills, hooks를 주기적으로 삭제한 뒤 여전히 중요한 것만 다시 만들라는 공식 지침을 인용했다. 다만 사용자는 품질 저하를 우려하고, 여러 설정을 쉽게 복구할 경로도 부족하다고 짚었다.
오스마니는 자신이 여전히 Agent Skills를 지지하며 SDLC 중심 Agent Skills pack을 관리한다고 말했다. 한편 폴 바카우스(Paul Bakaus)는 디자인 중심 Impeccable pack을 관리한다. 그는 skills가 범용 코딩 에이전트를 전문가처럼 만드는 데 도움을 줄 수 있지만, 커뮤니티 skill packs는 품질이 들쑥날쑥하고 때로 얇은 설명이나 모호한 workflow를 쓰기 때문에 몇 달간 실험이 쌓이면 local skill hygiene이 중요하다고 말했다.
해당 글은 6월 100개 인기 저장소 연구를 인용하며 lint-related leakage 62%, context bloat 42%, skill leakage 35%가 발견됐다고 전했다. 또한 오스마니는 Anthropic이 Claude 5 generation models용 Claude Code system prompt의 80% 이상을 제거했지만 내부 코딩 평가에서 측정 가능한 손실이 없었다는 보고를 언급했다. 다만 그는 그 평가가 공개되지 않았고 특정 모델과 특정 하니스에 적용된다고 경고했다.
오스마니는 개인화된 코딩 에이전트 skills 논문에서 한 개발자의 이력을 바탕으로 만든 skill이 다른 사람에게서 빌린 skill과 거의 비슷한 성능을 냈다고 말했다. 여러 개발자의 데이터로 만든 generic skill은 전반적으로 더 유용했다. 같은 선호가 여러 유사 작업에서 반복될 때 개인화 가능성은 더 커 보였지만, 실험이 LLM 기반 developer simulator를 사용했기 때문에 그는 그 결과를 최종 결론이 아니라 유망한 신호로 봤다.
별도 논문은 AGENTS.md와 CLAUDE.md식 context files를 실제 작업 17개, 288회 실행에서 테스트했고 Claude Code와 Codex에서 명확한 correctness gain을 찾지 못했다. 오스마니는 그래도 파일이 workflow behavior를 바꿨다고 말했다. 한 저장소에서는 느린 전체 test suite에 대한 경고 때문에 Claude가 더 targeted tests를 실행했고 시간을 덜 낭비했지만, implementation quality는 개선되지 않았다.
오스마니는 repository context files를 모델이 코드에서 추론할 수 없는 정보로 제한하라고 권고했다. 여기에 실행해야 할 올바른 checks, expensive operations, generated files, architectural boundaries, safety rules, unusual conventions가 포함된다. 그는 prose summaries가 code behavior 관련 질문 45개 중 4개에 답한 반면, source 자체는 45개 중 27개에 답했다는 다른 연구도 인용했다.
오스마니는 이제 몇 주마다 Claude Code의 /doctor를 실행해 unused skills, MCP servers, plugins, context cost, over-specified CLAUDE.md files, slow hooks, 기타 cruft를 점검한다고 말했다. 그는 Claude Code 내부의 /doctor는 설정을 감사하고, shell의 claude doctor는 설치 진단을 출력한다고 설명했다. 또한 project files가 정리된 뒤에도 auto-memory가 낡은 preferences를 유지할 수 있어 /memory는 별도로 검토한다고 덧붙였다.