[지디넷코리아]

AI는 이제 방금 저지른 실수를 그 자리에서 찾아 고칠 만큼 똑똑해졌다. 그런데 다음 과제가 시작되는 순간, 힘들게 배운 교훈을 전부 잊어버린다. 캐나다 앨버타대학교(University of Alberta)와 미국 버지니아공대(Virginia Tech) 등 국제 공동 연구진이 2026년 6월 발표한 논문은 이 문제를 ‘오답노트’로 해결한 자기진화 AI 에이전트 ‘매님에이전트(ManimAgent)’를 공개했다. 사람이 가르쳐주지 않아도, AI 내부 모델을 새로 학습시키지 않아도, 스스로 쌓은 성공과 실패의 기록만으로 성적이 오른다는 것이 핵심이다. AI에게 “왜 매번 같은 걸 다시 설명해야 하지?”라고 느껴본 사람이라면 주목할 만한 결과다.
자기진화 AI 에이전트가 겨냥한 ‘교차 과제 망각’ 문제
교차 과제 망각(Cross-task Forgetting)이란 AI 에이전트가 하나의 과제 안에서는 실수를 고치지만, 과제가 끝나면 그 교훈을 모두 버리고 다음 과제에서 똑같은 실수를 반복하는 현상을 말한다. 연구진은 이 문제를 수학 애니메이션 제작 과제에서 확인했다. 이때 사용한 도구가 매님(Manim)이다. 매님은 유명 수학 유튜브 채널 ‘3Blue1Brown’을 위해 개발된 파이썬(Python) 애니메이션 도구로, AI가 논문 한 단락을 읽고 이 도구로 교육용 영상을 만드는 것이 과제였다.
문제 장면은 이렇다. AI가 푸리에 변환 애니메이션을 만들면서 수천 개의 토큰을 쓰며 “수식은 왼쪽 정렬해야 한다”, “0.3초 전환은 너무 빠르다” 같은 교훈을 어렵게 배운다. 영상은 완성된다. 그런데 다음 날 확률 분포 애니메이션을 만들라고 하면, 똑같은 배치 실수를 저지르고 똑같은 수정 비용을 다시 치른다. 시험이 끝날 때마다 오답노트를 통째로 버리는 학생과 같다. 반면 수십 번 강의해 본 베테랑 교사는 다르다. ‘좋은 화면 구성의 틀’이라는 성공 경험과 ‘수식과 그림이 겹치면 학생들이 흐름을 놓친다’는 실패 교훈을 함께 갖고 새 수업에 들어간다. 연구진은 바로 이 두 종류의 기억을 AI에게 심었다.
기억 200개 쌓이자 합격률 62%에서 84.9%, 수정 횟수는 절반
연구진이 만든 에피소드 기억 은행(Episodic Memory Bank)은 AI가 과제를 마칠 때마다 성공 비결과 실패 패턴을 따로 저장하는 외부 저장소다. 성공 채널에는 높은 점수를 받은 장면의 ‘왜 좋았는지’ 설명이 참고 예시로 쌓이고, 실패 채널에는 실제로 오류를 고쳐낸 경우, 즉 망가진 코드를 살려냈거나 점수가 오른 경우에만 ‘함정 목록’이 기록된다. 다음 과제를 시작할 때 AI는 이 은행에서 비슷한 과제의 기억을 꺼내 읽고 작업에 들어간다.

그림1 EMB 크기별 합격률·수정 횟수·품질 변화 (출처: ManimAgent 논문 Figure 3)
효과는 수치로 뚜렷했다. 기억이 하나도 없을 때 사람 평가단이 매긴 첫 시도 합격률은 62.0%였지만, 기억이 200개 쌓이자 84.9%까지 올랐다. 5점 만점 품질 점수도 3.26점에서 3.88점으로 상승했다. 더 인상적인 것은 수정 횟수다. 평균 12.2회였던 수정 작업이 6.5회로 거의 절반이 됐다. 사람으로 치면 초안을 12번 고쳐 쓰던 신입이 6번 만에 통과하는 숙련자가 된 셈이고, 매일 수십 개의 과제를 처리하는 실제 서비스라면 이 차이가 누적되어 비용과 시간에서 완전히 다른 결과를 만든다. 흥미로운 비교 대상도 있다. 공식 문서와 모범 코드를 검색해 참고하는 검색 증강 생성(RAG) 방식은 합격률 83.3%로 꽤 높았지만, 수정 횟수는 11.4회로 여전히 많았다. 남이 쓴 교과서를 참고하는 것과 내가 직접 틀려본 오답노트를 보는 것의 차이가 여기서 갈렸다.
성공 기억은 점수를 올리고, 실패 기억은 시간을 아낀다
두 기억은 하는 일이 서로 달랐다. 연구진이 성공 기억만 지우자 합격률이 84.9%에서 70.0%로 무너졌다. 반대로 실패 기억만 지우자 합격률은 80.9%로 비교적 버텼지만, 수정 횟수가 6.5회에서 11.6회로 다시 치솟았다. 정리하면 성공 기억은 “처음부터 잘 만드는 능력”을, 실패 기억은 “삽질을 줄이는 능력”을 담당한다. 좋은 참고서만 있고 오답노트가 없는 학생은 문제를 풀 수는 있지만 시간이 오래 걸리고, 오답노트만 있고 모범답안이 없는 학생은 함정은 피하지만 좋은 답을 쓰지 못하는 것과 같은 구조다.
저장 방식에도 장치가 있다. 실패 기억은 아무 오류나 저장하지 않는다. 오류를 고친 뒤 실제로 렌더링에 성공했거나 평가 점수가 5점 이상 올라간, 즉 ‘원인과 해결이 검증된’ 경우에만 기록된다. 이 검증 절차를 없애고 모든 실패를 저장하자 합격률이 81.8%로 떨어졌다. 실수를 무작정 모으는 것이 아니라 확실히 배운 실수만 골라 적는 것, 좋은 오답노트의 조건은 AI에게도 똑같이 적용됐다. 또 하나 주목할 점은 이 모든 과정에 AI 모델의 가중치 업데이트, 즉 재학습이 전혀 없었다는 것이다. 기억은 순전히 외부 저장소에 글로 쌓였다.
채점관 AI는 사람과 거의 안 맞았는데도 성적이 오른 역설
이 연구에는 반전이 하나 숨어 있다. 작업 중간중간 화면을 채점하고 기억 저장 여부를 결정하는 심판 역할은 비전 언어 모델(VLM), 즉 이미지를 보고 평가하는 AI가 맡았다. 그런데 이 AI 심판의 점수와 사람 평가단의 점수를 비교하자 상관계수가 -0.17로, 거의 무관하거나 오히려 살짝 반대 방향이었다. AI 심판이 좋다고 한 영상을 사람은 별로라고 보는 경우가 적지 않았다는 뜻이다.
그럼에도 최종 성적은 뚜렷이 올랐다. 연구진은 이 착시를 막기 위해 평가 설계를 이중으로 짰다. 헤드라인 성적표는 AI 심판이 아니라, 어떤 조건의 영상인지 전혀 모르는 블라인드 평가단 54명이 175개 영상을 나눠 보고 매긴 점수만 사용했다. AI 심판은 어디까지나 작업 중의 내부 신호로만 쓴 것이다. 불완전한 심판이라도 ‘방금 전보다 나아졌는가’라는 상대 비교와 검증 절차를 거치면 쓸 만한 학습 신호가 된다는 점, 그리고 AI가 만든 결과를 AI가 채점한 점수를 그대로 믿으면 안 된다는 점을 동시에 보여주는 대목이다. 다만 사람 평가 역시 평가자마다 편차가 컸다는 점은 논문도 인정하는 한계다.
재학습 없는 성장, ‘기억 관리’가 AI 경쟁력이 될 가능성
이번 연구가 흥미로운 이유는 값비싼 재학습 없이, 외부에 쌓은 텍스트 기억만으로 AI 성능이 꾸준히 오를 수 있음을 사람 평가로 입증했다는 점이다. 다만 한계도 분명하다. 검증된 기억은 200여 개 규모에서만 확인됐고, 수백만 개 규모로 커지면 중복 제거와 정리가 필요할 가능성이 있다. 기억이 쌓일수록 과제당 작업 시간이 19분에서 31분으로 늘어나는 비용 문제, AI 모델이 업그레이드되면 옛 기억이 오히려 낡은 조언이 되는 ‘기억 부패’ 위험도 연구진 스스로 지적했다. 챗GPT의 메모리 기능처럼 대화형 AI에도 기억이 도입되는 흐름 속에서, 앞으로는 무엇을 기억시키고 무엇을 버릴지 관리하는 능력이 AI 활용의 새로운 경쟁력이 될지 두고 볼 필요가 있다.
FAQ( ※ 이 FAQ는 본지가 리포트를 참고해 자체 작성한 내용입니다.)
Q1. 매님에이전트(ManimAgent)는 무엇을 하는 AI인가요?
A. 과학 논문의 한 단락을 읽고 그 내용을 설명하는 수학 교육용 애니메이션을 자동으로 만드는 AI입니다. 특히 과제를 할 때마다 성공 비결과 실패 교훈을 ‘기억 은행’에 저장해 두고, 다음 과제에서 꺼내 쓰면서 스스로 실력이 좋아지는 것이 특징입니다.
Q2. AI가 기억을 쌓으면 정말 재학습 없이도 똑똑해지나요?
A. 이번 연구에서는 그렇게 나타났습니다. AI 모델 자체는 전혀 바꾸지 않고 외부 저장소에 경험만 쌓았는데, 기억 200개가 모이자 사람 평가 기준 첫 시도 합격률이 62.0%에서 84.9%로 올랐습니다. 다만 기억이 수백만 개로 커질 때도 유지되는지는 추가 검증이 필요합니다.
Q3. 성공 기억과 실패 기억을 왜 따로 저장하나요?
A. 역할이 다르기 때문입니다. 성공 기억은 좋은 결과물의 본보기 역할을 해 첫 시도 품질을 올리고, 실패 기억은 피해야 할 함정 목록 역할을 해 수정 횟수를 줄입니다. 실험에서 성공 기억을 지우면 합격률이, 실패 기억을 지우면 작업 속도가 크게 나빠졌습니다.
기사에 인용된 리포트 원문은 arXiv에서 확인할 수 있다.
리포트명: ManimAgent: Self-Evolving Multimodal Agents for Visual Education
이미지 출처: AI 생성 콘텐츠
■ 이 기사는 AI 전문 매체 ‘AI 매터스’와 제휴를 통해 제공됩니다. 기사는 클로드 3.5 소네트와 챗GPT를 활용해 작성되었습니다. (☞ 기사 원문 바로가기)
