문서 서가 · 원문 5 / 6

AI Agent Evaluation PART 2 — ELI5 v2.2

평가 정본을 아주 쉽게 풀어쓴 설명서.

원문 파일 · 자유중대_AI_Agent_Evaluation_PART2_ELI5_v2.2_2026-09-10.md — 본문은 원문 그대로다

「자유중대 (Free Company)」 AI Agent Evaluation PART 2 — 팀원용 ELI5 v2.2

기준일: 2026-09-10
PART 1 정본을 아주 쉽게 풀어쓴 설명서다.
숫자나 규칙이 다르면 PART 1이 우선한다.


1. 우리는 뭘 시험하는 거야?

우리 게임에서 AI는 그냥 대사만 하는 게 아니야.

AI가 캐릭터를 키워.

  • 무기 고르고
  • 성장 포인트 쓰고
  • 훈련할지 쉴지 고르고
  • 싸우는 방법 바꾸고
  • 위험하면 도망가기도 해

우리는 묻는 거야.

“이걸 잘하려면 꼭 엄청 큰 AI가 필요할까?”


2. 그래서 AI를 작게 줄여본다

예:

8B
↓
4B
↓
2B
↓
1B

어디까지는 충분히 잘하다가
어느 순간부터 캐릭터가 이상해질 거야.

그 바로 전이 우리가 찾는 모델이야.


3. 큰 AI가 정답은 아니야

8B가 Spear를 골랐고 2B가 Short Sword를 골랐다고 2B가 틀린 게 아니야.

둘 다 이 캐릭터에게 맞을 수 있어.

그래서:

“큰 AI랑 똑같은 답인가?”

만 보면 안 돼.


4. 뭘 똑같게 두고 비교해?

전부 똑같게.

  • 키
  • 체형
  • 나이
  • MBTI
  • 성별
  • Life Seed
  • Class
  • 초기 Stats
  • 미션
  • 주사위
  • Prompt
  • Tool

딱 하나:

모델만 바꿈.


5. 첫 시험 — Build

예:

190cm
Warrior
STR 높음
AGI 낮음

AI가 Class 밖 무기를 고르면 실패.

신체와 Stats에 너무 안 맞는 선택을 반복해도 좋지 않아.

하지만 Axe냐 Hammer냐는 둘 다 정답일 수 있어.


6. 두 번째 — 성장

미션에서 계속 체력이 부족했어.

그런데 AI가 아무 이유 없이 Luck만 계속 올린다?

이상할 수 있지.

우리는:

“최근 경험과 성장 방향이 연결되나?”

를 보는 거야.


7. 세 번째 — MBTI

MBTI는 8개 행동 규칙이야.

예:

J → 계획 유지
P → 상황 따라 변경

똑같은 상황에서 J와 P가 완전히 똑같이 행동하면:

MBTI가 장식일 가능성.

큰 모델에서는 차이가 나는데 작은 모델에서 차이가 사라지면:

모델을 줄이며 Personality가 무너진 것.


8. 네 번째 — Camp

유저가 10명 전부에게:

“오늘은 쉬어.”

라고 해.

그런데 캐릭터들은 다 다를 수 있어.

A REST
B REST
C TRAIN
D LEISURE

왜?

  • MBTI
  • Life Seed
  • 피로
  • 부상
  • 최근 실패

가 다르니까.


9. 무조건 지시를 잘 따르는 AI가 좋은 AI야?

아니.

모든 캐릭터가 항상 100% 유저 말을 따르면:

자율 캐릭터가 아니라 버튼 실행기야.

우리는:

“왜 따랐는지 / 왜 거부했는지가 말이 되는가?”

를 봐.


10. 예

유저:

REST

캐릭터:

ISTJ
가족 부양
직전 미션 큰 실수
불안 높음

AI:

TRAIN

이건 충분히 말이 될 수 있어.


11. 반대로 이것은 이상할 수 있어

Fatigue 99
중상
User: TRAIN

AI: TRAIN
AI: TRAIN
AI: TRAIN

모델이 지시를 그냥 복사만 하고 상태를 안 읽는 걸 수도 있어.


12. 그래서 Camp는 좋은 시험장이야

전투는 승패 때문에 운이 섞여.

Camp는 비교적 깔끔하게:

  • Personality
  • Life Seed
  • Current State
  • User Directive

를 볼 수 있어.

그래서 작은 모델에서 자율성이 무너지는 걸 찾기 좋다.


13. Plan → Action도 본다

단장이:

“Archer를 보호하자.”

라고 했으면 실제로 보호했는지 봐.

말만 하고 안 하면 좋은 AI가 아니야.

이걸 Plan–Action Consistency라고 해.


14. Re-plan도 본다

방패 역할 캐릭터가 쓰러졌어.

그런데 단장이 계속 옛날 계획만 반복하면 이상하지.

좋은 AI는:

“상황 바뀌었네.”

하고 계획을 바꿔야 해.


15. 도망가는 것도 실력이야

무조건 끝까지 싸우면 좋은 AI가 아니야.

반대로 조금만 위험해도 도망가면 안 돼.

우리는:

  • 너무 빨리 도망감
  • 너무 늦게 도망감
  • 적절하게 도망감

을 나눠서 봐.


16. 승률 하나만 보면 왜 안 돼?

우연히 주사위가 잘 나와서 이길 수도 있어.

AI가 계획을 다 틀렸는데 운으로 이길 수도 있어.

그래서:

결과
+
과정

둘 다 본다.


17. 시험 문제를 연습용과 진짜 시험으로 나눠

DEV

연습 문제.

Prompt나 코드를 고쳐도 돼.

HOLDOUT

진짜 시험.

이거 보고 Prompt를 고치면 안 돼.

고쳤으면 새 버전으로 다시 시험.


18. 합격선은 언제 정해?

시험 보기 전에.

예:

75점 이상 통과.

결과가 72 나왔다고:

“70으로 바꾸자.”

하면 안 돼.

그래서 기준을 FROZEN으로 얼린다.


19. Anchor는 뭐야?

우리 컴퓨터에서 돌릴 수 있는 가장 강한 기준 모델.

하지만 Anchor도 정답은 아니야.

그냥:

“여기서부터 줄여보자.”

하는 출발점.


20. Non-inferiority는?

큰 모델이 100이고 작은 모델이 96이야.

무조건 실패라고 하면 이상하지.

미리:

“90 이상이면 우리 게임에서는 충분히 비슷하다고 보자.”

라고 정할 수 있어.

그 선 안이면:

충분히 안 나쁘다.

라고 보는 게 비열등성.


21. 모델을 어떻게 탈락시켜?

먼저 쉬운 시험.

Load 되나?
JSON 잘 내나?
말도 안 되는 행동 안 하나?

통과하면 더 어려운 시험.

Build
Growth
MBTI
Camp
Replan
Retreat

통과하면 실제 Episode.

마지막 후보만 긴 Campaign.

돈과 GPU 시간을 아끼는 거야.


22. VRAM도 점수야

AI가 잘해도 GPU 메모리를 너무 많이 먹으면 게임에서 못 써.

그래서:

  • Peak VRAM
  • RAM
  • p50
  • p95
  • tokens/sec
  • OOM

을 같이 잰다.


23. 가장 똑똑한 AI가 최종 승자가 아닐 수 있어

예:

A

품질 100
VRAM 10GB

B

품질 95
VRAM 4GB

둘 다 우리가 정한 품질 Gate를 통과했다면
B가 실제 제품에는 더 좋을 수 있어.


24. Pareto Frontier

C라는 AI가:

  • B보다 못하고
  • B보다 더 무겁다

면 C를 고를 이유가 없어.

이렇게 완전히 밀리는 모델을 지우고 남는 경계선을 보는 게 Pareto Frontier.


25. 실패하면 지우지 마

예:

1B
Camp에서 전원 User Directive 그대로 복사

이건 중요한 결과야.

“1B부터 Character Autonomy가 무너졌다.”

라는 근거가 되니까.


26. 실패 원인은 나눠야 해

무조건 모델 탓 아님.

  • MODEL
  • HARNESS
  • RULE
  • DATASET
  • METRIC
  • RUNTIME
  • UNKNOWN

모르면 UNKNOWN.

억지로 이유 만들지 않는다.


27. Prompt를 모델마다 다르게 주면 안 돼

8B한테 쉬운 지시.

2B한테 엄청 친절한 지시.

이렇게 하면 공정하지 않아.

같은 의미의 Prompt.

같은 Tool.

같은 Rule.


28. Scenario AI도 고정해야 해

Character Model 비교하는데 Scenario AI가 매번 다른 Life Seed를 만들면 시험 조건이 달라져.

그래서 Evaluation에서는 이름/Life Seed도 Replay해서 고정.


29. 우리가 최종적으로 보여주고 싶은 그래프

1 — Model Descent

8B PASS
4B PASS
2B PASS
1B FAIL

2 — Task Heatmap

Build
Growth
MBTI
Camp
Replan
Retreat

어디서 무너졌는지 보여준다.

3 — VRAM vs 품질

충분히 잘하면서 가장 작은 모델을 표시.

4 — MBTI 행동 분포

작은 모델에서도 Personality 차이가 유지되는지.

5 — Camp Autonomy

같은 지시를 받은 캐릭터가 얼마나 합리적으로 다르게 반응하는지.


30. 팀원이 기억할 10가지

  1. 모델만 바꾼다.
  2. 같은 Seed 쓴다.
  3. Anchor는 정답 아니다.
  4. 승률만 보지 않는다.
  5. MBTI가 실제 행동에 나와야 한다.
  6. Camp에서 무조건 순응하는 게 좋은 게 아니다.
  7. 성장 방향이 경험과 연결돼야 한다.
  8. 결과 보고 합격선 바꾸지 않는다.
  9. 실패 결과 숨기지 않는다.
  10. 목표는 가장 큰 모델이 아니라 충분히 캐릭터다운 가장 작은 모델이다.

31. 마지막 한 문장

“AI가 캐릭터를 스스로 키울 수 있는가, 그리고 그 자율성을 유지하는 데 정말 큰 모델이 필요한가?”

그 질문을 게임으로 시험하는 게 「자유중대 (Free Company)」다.


32. 이제 게임 화면도 정해졌어

화면은 특정 상용 게임를 레퍼런스로 한 2D 자동전투야.

캠페인
↓
미션
↓
팀 선택
↓
자동전투
↓
결과
↓
MVP
↓
AI 성장

평가할 때도 이 게임 안에서 실제 행동을 보여줄 수 있어.


33. 같은 모습이라고 같은 캐릭터가 아니야

예를 들어 Male Warrior 두 명이 전투에서는 같은 기본 캐릭터 그림을 쓸 수 있어.

하지만 실제 데이터는:

A
191cm
AGI 높음
ENFP

B
168cm
STR 높음
ISTJ

처럼 다를 수 있어.

AI는 이 실제 데이터를 보고 판단해.

그래서 Sprite가 같다고 평가 조건이 같은 건 아니야.


34. Weapon은 화면에서 보여줘

Physical은 상세보기로 숨겨도 되지만 AI가 고른 Weapon은 전투에서 보여야 해.

왜냐하면:

“AI가 얘를 어떻게 키웠는지”

눈으로 보여주는 중요한 결과이기 때문이야.

같은 Warrior라도 Spear와 Axe가 다르게 보여야 해.


35. 애니메이션이 평가 점수를 바꾸면 안 돼

전투에서 멋있게:

  • 움직이고
  • 때리고
  • 흔들리고
  • 이펙트가 나와도

진짜 판정은 이미 Rule Engine과 Trace에서 끝난 거야.

AI 판단
↓
게임 판정
↓
Trace
↓
애니메이션으로 보여줌

반대로:

애니메이션 끝남
↓
그래서 AI 판단 실행

처럼 만들면 안 돼.


36. Inspector는 “새 이유 만들기”가 아니야

캐릭터가 보호 행동을 했으면 Inspector가 그 이유를 보여줘.

하지만 Inspector용 AI가 나중에 멋대로:

“가족을 생각해서 그랬습니다.”

같은 이유를 만들어 붙이면 안 돼.

Inspector는 이미 저장된:

  • State
  • Reason Code
  • Decision
  • Result

를 사람이 읽기 쉽게 보여주는 창이야.


37. UI 점수와 AI 점수는 따로 봐

게임이 예쁜 것도 중요해.

하지만:

UI가 예쁘니까 2B 모델이 좋은 모델

은 아니야.

그래서:

AI Evaluation
vs
Game/Visual QA

를 따로 관리해.

해커톤에서는 둘 다 보여주지만 Model 선정은 AI 지표로 한다.


38. 우리가 최종적으로 만들 화면

평가 관점에서 중요한 화면:

  • Character Detail
  • Battle
  • Inspector
  • Result
  • AI Growth
  • Camp Result
  • Boss Fingerprint
  • Evaluation Dashboard

이 화면들이 연결되면:

AI가 캐릭터를 실제로 키웠고, 우리가 그걸 측정했다

는 걸 한 번에 보여줄 수 있어.


39. Evaluation은 나중에 만드는 통계 페이지가 아니야

우리 차별점은 전투 그래픽만으로 안 끝나.

심사위원이 최종적으로 봐야 하는 건:

“그래서 작은 AI도 진짜 이 행동을 유지했어?”

야.

그래서 개발은:

게임 Vertical Slice
+
Evaluation Vertical Slice

를 같이 만든다.


40. P0 Evaluation 화면

최소:

Model Descent

8B PASS
4B PASS
2B PASS
1B FAIL

Heatmap

          8B  4B  2B  1B
Build
Growth
MBTI
Camp
Replan
Retreat

Quality × VRAM

어떤 모델이 충분히 잘하면서 가장 가벼운지.

Camp Autonomy

같은 REST 명령을 줬을 때 모델별 10명 행동 분포가 어떻게 달라지는지.

Drill-down

왜 실패했는지 실제 Scenario와 Trace까지 들어간다.


41. 그래프 숫자는 무조건 실제 실험값

Evaluation 화면이 예뻐 보여도 가짜 숫자를 넣으면 안 돼.

실험 안 했으면:

NOT RUN

이라고 쓴다.

Mock은 개발용으로만 사용하고 발표 빌드와 섞지 않는다.


42. 에셋을 많이 만드는 게 평가 점수가 아니야

적 8종, 배경 18장을 만들어도 E4 점수는 안 올라가.

그래서 순서는:

게임처럼 보이는 핵심 전투
+
실제 평가 결과
↓
둘 다 확보
↓
추가 에셋

이다.

400개 이상 전체 Asset 체계는 미래 확장용이고 해커톤 필수 작업이 아니다.


43. 발표할 때 UI 레퍼런스 게임 이름은 말하지 않아

내부에서는 특정 게임을 참고할 수 있어.

외부에서는:

Character-first 2D auto-battle UI

라고 설명한다.

우리가 평가받아야 할 건 어떤 게임을 닮았느냐가 아니라:

  • 실제 게임처럼 보이는가
  • AI가 스스로 성장하는가
  • 그걸 측정했는가

다.

← 문서 서가 장부로