내 작업 폴더를 24시간 지켜보는 '상주 AI'를 하나 붙였다.
모델은 올라마(Ollama)를 사용했다. ChatGPT처럼 인터넷에 접속해서 쓰는 AI가 아니라, 내 컴퓨터에 설치해 놓고 돌리는 AI라서 구독료도 사용료도 들지 않는다. 이 AI에게는 이상한 점을 찾아 신고하는 일만 맡기고, 무엇을 고칠지 판단하는 일은 맡기지 않았다. 사흘 돌려 보니 등록한 것의 94%가 잘못된 지적이었다.
그럼 올라마가 지적한 내용에 대한 판단은 누가 할까? 앨리(이 폴더 전체를 관리하는 메인 AI)가 한다. 올라마가 등록하면 앨리가 오류 여부를 판단하고 직접 수정까지 진행한다. 올라마는 코드나 문서를 건드리지 않는다.
사실 올라마의 권한을 어느 정도로 제한해야 할지 고민이 있었다. 아무래도 최신 모델은 아니니까, 올라마에게 판단을 맡기는 건 부담스러웠다. 틀린 판단이 그대로 반영되는 위험이 컸다. 참고했던 에르메스의 AI 에이전트는 권한을 더 주고 판단까지 맡기는 구조였는데, 나는 거기까지는 가지 않았다.
도입하던 날 앨리에게 이렇게 요청했다.
올라마는 하위 모델이니 상위 모델인 네가 정밀하게 관리해줘. 잘 관리하면 좋은 결과로 이어질 거야. 그리고 네가 스스로 일할 수 있는 환경을 만들어 갔으면 좋겠어.
올라마를 저장소 시스템에 도입하기 전에 테스트 케이스 20개로 실험을 진행했다.
오탐률은 10%, 통과 기준인 20%를 넘지 않아 무사히 테스트를 마쳤다. 그런데 실제 저장소에서 실행한 결과는 딴판이었다. 사흘 동안 37건을 신고했고, 34건이 잘못된 지적이었다. 오탐률 94%. 이전 실험과는 너무 큰 성능 차이를 보인 것이다.
원인은 모델 자체가 아니었다. 살펴야 할 정보가 많다 보니 한 번에 전달할 수 있는 글자 수 제한에 걸렸고, 그 바람에 지켜야 할 규칙이 올라마에게 제대로 전달되지 않았다. 규칙을 읽지 못한 모델은 엉뚱한 내용을 지어내 오류로 등록했다. 아예 존재하지 않는 파일을 고쳐야 한다고 신고하기도 했다.
상주 모델을 선택한 첫 번째 이유는 비용이었다. 그다음이 안정성이다.
다만 실험을 통과했다고 해서 실제로 도입했을 때 똑같은 결과를 보장하지 않는다는 것도 알 수 있었다. 이번 문제는 글자 수 제한이 맥락을 끊어 버린 데서 비롯됐으니 실험 자체가 잘못됐다고 보기는 어렵다. 실험과 실제 사이에는 언제든 이런 차이가 생길 수 있다.
도입 당시 앨리에게 스스로 관리할 수 있는 환경을 만들고, 올라마가 제 몫을 하도록 잘 관리해 달라고 부탁했는데, 그 부탁이 잘 지켜지길 바란다.