인공지능 모델의 출시 이후 성능 변화 여부를 객관적으로 측정하려는 시도가 이어지고 있습니다. 개발자 닌자호크가 만든 오픈소스 프로젝트 ‘라이브너프’는 앤트로픽의 최신 언어 모델인 클로드 오퍼스 5.5를 대상으로 장기적인 벤치마크를 수행하고 있습니다.
클로드 오퍼스 5.5는 지난 9월 22일에 정식 출시되었습니다. 라이브너프는 이틀 뒤인 9월 24일 밤부터 기준선 데이터를 수집하기 시작했습니다. 9월 30일 현재 기준으로 총 30일간의 측정 기간 중 6일분이 완료된 상태입니다.
하루 평균 90개의 샘플을 테스트하며, 특정 해시값으로 고정된 클로드 코드 CLI 버전을 사용하여 변수를 통제하고 있습니다.
현재까지의 결과로는 성능 저하, 즉 이른바 너프가 발생했다는 판정이 내려지지 않았습니다. 프로젝트 측이 제시한 기준에 따르면, 연속된 두 번의 10일 구간에서 유의미한 차이가 발견되어야만 공식적인 경고 신호로 간주됩니다. 이에 따라 최초의 판정 가능성이 있는 시점은 대략 10월 24일로 잡혀 있습니다.
그 전까지는 공개된 결과 표가 비어 있게 됩니다.
이 프로젝트가 주목받은 배경에는 커뮤니티의 불신이 자리 잡고 있습니다. Hacker News에서는 해당 저장소가 약 267개의 스타를 받으며 화제가 되었고, 관련 스레드는 높은 조회수를 기록했습니다. 일부 이용자들은 모델이 조용히 하향 조정되는 것이 아니냐는 의문을 제기해 왔습니다.
하지만 이러한 주장들은 대부분 체감상의 문제이거나 초기 사용자의 기대치와 실제 성능 사이의 괴리에서 비롯된 경우가 많다는 지적도 나옵니다.
다른 벤치마크 프로젝트인 ‘너프 벤치’ 역시 유사한 방식으로 작동합니다. 이들은 출시 당일의 성능을 기준으로 삼아 10% 이상의 편차가 발생할 경우 변경 사항으로 분류합니다. 과거 클로드 오퍼스 4.6의 성능 저하 사례를 포착했던 이력이 있어 신뢰도를 인정받고 있습니다.
다만 대규모 언어 모델은 프롬프트의 미세한 문장 변화나 캐싱 최적화 등 내부 인프라의 복잡한 변수에 따라 출력 결과가 달라질 수 있어 단순 비교에는 한계가 존재합니다.
라이브너프의 핵심 가치는 감정에 의존하지 않는 데이터 축적에 있습니다. 기억에 의존하는 대신 문서화된 기준선을 통해 객관적인 비교가 가능하도록 설계되었습니다. 따라서 향후 몇 주간 추가적인 데이터가 쌓여야만 명확한 결론을 도출할 수 있을 것입니다.