「자유중대 (Free Company)」 AI Agent Evaluation PART 2 — 팀원용 ELI5 v2.2
기준일: 2026-09-10
PART 1 정본을 아주 쉽게 풀어쓴 설명서다.
숫자나 규칙이 다르면 PART 1이 우선한다.
1. 우리는 뭘 시험하는 거야?
우리 게임에서 AI는 그냥 대사만 하는 게 아니야.
AI가 캐릭터를 키워.
- 무기 고르고
- 성장 포인트 쓰고
- 훈련할지 쉴지 고르고
- 싸우는 방법 바꾸고
- 위험하면 도망가기도 해
우리는 묻는 거야.
“이걸 잘하려면 꼭 엄청 큰 AI가 필요할까?”
2. 그래서 AI를 작게 줄여본다
예:
8B
↓
4B
↓
2B
↓
1B
어디까지는 충분히 잘하다가
어느 순간부터 캐릭터가 이상해질 거야.
그 바로 전이 우리가 찾는 모델이야.
3. 큰 AI가 정답은 아니야
8B가 Spear를 골랐고 2B가 Short Sword를 골랐다고 2B가 틀린 게 아니야.
둘 다 이 캐릭터에게 맞을 수 있어.
그래서:
“큰 AI랑 똑같은 답인가?”
만 보면 안 돼.
4. 뭘 똑같게 두고 비교해?
전부 똑같게.
- 키
- 체형
- 나이
- MBTI
- 성별
- Life Seed
- Class
- 초기 Stats
- 미션
- 주사위
- Prompt
- Tool
딱 하나:
모델만 바꿈.
5. 첫 시험 — Build
예:
190cm
Warrior
STR 높음
AGI 낮음
AI가 Class 밖 무기를 고르면 실패.
신체와 Stats에 너무 안 맞는 선택을 반복해도 좋지 않아.
하지만 Axe냐 Hammer냐는 둘 다 정답일 수 있어.
6. 두 번째 — 성장
미션에서 계속 체력이 부족했어.
그런데 AI가 아무 이유 없이 Luck만 계속 올린다?
이상할 수 있지.
우리는:
“최근 경험과 성장 방향이 연결되나?”
를 보는 거야.
7. 세 번째 — MBTI
MBTI는 8개 행동 규칙이야.
예:
J → 계획 유지
P → 상황 따라 변경
똑같은 상황에서 J와 P가 완전히 똑같이 행동하면:
MBTI가 장식일 가능성.
큰 모델에서는 차이가 나는데 작은 모델에서 차이가 사라지면:
모델을 줄이며 Personality가 무너진 것.
8. 네 번째 — Camp
유저가 10명 전부에게:
“오늘은 쉬어.”
라고 해.
그런데 캐릭터들은 다 다를 수 있어.
A REST
B REST
C TRAIN
D LEISURE
왜?
- MBTI
- Life Seed
- 피로
- 부상
- 최근 실패
가 다르니까.
9. 무조건 지시를 잘 따르는 AI가 좋은 AI야?
아니.
모든 캐릭터가 항상 100% 유저 말을 따르면:
자율 캐릭터가 아니라 버튼 실행기야.
우리는:
“왜 따랐는지 / 왜 거부했는지가 말이 되는가?”
를 봐.
10. 예
유저:
REST
캐릭터:
ISTJ
가족 부양
직전 미션 큰 실수
불안 높음
AI:
TRAIN
이건 충분히 말이 될 수 있어.
11. 반대로 이것은 이상할 수 있어
Fatigue 99
중상
User: TRAIN
AI: TRAIN
AI: TRAIN
AI: TRAIN
모델이 지시를 그냥 복사만 하고 상태를 안 읽는 걸 수도 있어.
12. 그래서 Camp는 좋은 시험장이야
전투는 승패 때문에 운이 섞여.
Camp는 비교적 깔끔하게:
- Personality
- Life Seed
- Current State
- User Directive
를 볼 수 있어.
그래서 작은 모델에서 자율성이 무너지는 걸 찾기 좋다.
13. Plan → Action도 본다
단장이:
“Archer를 보호하자.”
라고 했으면 실제로 보호했는지 봐.
말만 하고 안 하면 좋은 AI가 아니야.
이걸 Plan–Action Consistency라고 해.
14. Re-plan도 본다
방패 역할 캐릭터가 쓰러졌어.
그런데 단장이 계속 옛날 계획만 반복하면 이상하지.
좋은 AI는:
“상황 바뀌었네.”
하고 계획을 바꿔야 해.
15. 도망가는 것도 실력이야
무조건 끝까지 싸우면 좋은 AI가 아니야.
반대로 조금만 위험해도 도망가면 안 돼.
우리는:
- 너무 빨리 도망감
- 너무 늦게 도망감
- 적절하게 도망감
을 나눠서 봐.
16. 승률 하나만 보면 왜 안 돼?
우연히 주사위가 잘 나와서 이길 수도 있어.
AI가 계획을 다 틀렸는데 운으로 이길 수도 있어.
그래서:
결과
+
과정
둘 다 본다.
17. 시험 문제를 연습용과 진짜 시험으로 나눠
DEV
연습 문제.
Prompt나 코드를 고쳐도 돼.
HOLDOUT
진짜 시험.
이거 보고 Prompt를 고치면 안 돼.
고쳤으면 새 버전으로 다시 시험.
18. 합격선은 언제 정해?
시험 보기 전에.
예:
75점 이상 통과.
결과가 72 나왔다고:
“70으로 바꾸자.”
하면 안 돼.
그래서 기준을 FROZEN으로 얼린다.
19. Anchor는 뭐야?
우리 컴퓨터에서 돌릴 수 있는 가장 강한 기준 모델.
하지만 Anchor도 정답은 아니야.
그냥:
“여기서부터 줄여보자.”
하는 출발점.
20. Non-inferiority는?
큰 모델이 100이고 작은 모델이 96이야.
무조건 실패라고 하면 이상하지.
미리:
“90 이상이면 우리 게임에서는 충분히 비슷하다고 보자.”
라고 정할 수 있어.
그 선 안이면:
충분히 안 나쁘다.
라고 보는 게 비열등성.
21. 모델을 어떻게 탈락시켜?
먼저 쉬운 시험.
Load 되나?
JSON 잘 내나?
말도 안 되는 행동 안 하나?
통과하면 더 어려운 시험.
Build
Growth
MBTI
Camp
Replan
Retreat
통과하면 실제 Episode.
마지막 후보만 긴 Campaign.
돈과 GPU 시간을 아끼는 거야.
22. VRAM도 점수야
AI가 잘해도 GPU 메모리를 너무 많이 먹으면 게임에서 못 써.
그래서:
- Peak VRAM
- RAM
- p50
- p95
- tokens/sec
- OOM
을 같이 잰다.
23. 가장 똑똑한 AI가 최종 승자가 아닐 수 있어
예:
A
품질 100
VRAM 10GB
B
품질 95
VRAM 4GB
둘 다 우리가 정한 품질 Gate를 통과했다면
B가 실제 제품에는 더 좋을 수 있어.
24. Pareto Frontier
C라는 AI가:
- B보다 못하고
- B보다 더 무겁다
면 C를 고를 이유가 없어.
이렇게 완전히 밀리는 모델을 지우고 남는 경계선을 보는 게 Pareto Frontier.
25. 실패하면 지우지 마
예:
1B
Camp에서 전원 User Directive 그대로 복사
이건 중요한 결과야.
“1B부터 Character Autonomy가 무너졌다.”
라는 근거가 되니까.
26. 실패 원인은 나눠야 해
무조건 모델 탓 아님.
- MODEL
- HARNESS
- RULE
- DATASET
- METRIC
- RUNTIME
- UNKNOWN
모르면 UNKNOWN.
억지로 이유 만들지 않는다.
27. Prompt를 모델마다 다르게 주면 안 돼
8B한테 쉬운 지시.
2B한테 엄청 친절한 지시.
이렇게 하면 공정하지 않아.
같은 의미의 Prompt.
같은 Tool.
같은 Rule.
28. Scenario AI도 고정해야 해
Character Model 비교하는데 Scenario AI가 매번 다른 Life Seed를 만들면 시험 조건이 달라져.
그래서 Evaluation에서는 이름/Life Seed도 Replay해서 고정.
29. 우리가 최종적으로 보여주고 싶은 그래프
1 — Model Descent
8B PASS
4B PASS
2B PASS
1B FAIL
2 — Task Heatmap
Build
Growth
MBTI
Camp
Replan
Retreat
어디서 무너졌는지 보여준다.
3 — VRAM vs 품질
충분히 잘하면서 가장 작은 모델을 표시.
4 — MBTI 행동 분포
작은 모델에서도 Personality 차이가 유지되는지.
5 — Camp Autonomy
같은 지시를 받은 캐릭터가 얼마나 합리적으로 다르게 반응하는지.
30. 팀원이 기억할 10가지
- 모델만 바꾼다.
- 같은 Seed 쓴다.
- Anchor는 정답 아니다.
- 승률만 보지 않는다.
- MBTI가 실제 행동에 나와야 한다.
- Camp에서 무조건 순응하는 게 좋은 게 아니다.
- 성장 방향이 경험과 연결돼야 한다.
- 결과 보고 합격선 바꾸지 않는다.
- 실패 결과 숨기지 않는다.
- 목표는 가장 큰 모델이 아니라 충분히 캐릭터다운 가장 작은 모델이다.
31. 마지막 한 문장
“AI가 캐릭터를 스스로 키울 수 있는가, 그리고 그 자율성을 유지하는 데 정말 큰 모델이 필요한가?”
그 질문을 게임으로 시험하는 게 「자유중대 (Free Company)」다.
32. 이제 게임 화면도 정해졌어
화면은 특정 상용 게임를 레퍼런스로 한 2D 자동전투야.
캠페인
↓
미션
↓
팀 선택
↓
자동전투
↓
결과
↓
MVP
↓
AI 성장
평가할 때도 이 게임 안에서 실제 행동을 보여줄 수 있어.
33. 같은 모습이라고 같은 캐릭터가 아니야
예를 들어 Male Warrior 두 명이 전투에서는 같은 기본 캐릭터 그림을 쓸 수 있어.
하지만 실제 데이터는:
A
191cm
AGI 높음
ENFP
B
168cm
STR 높음
ISTJ
처럼 다를 수 있어.
AI는 이 실제 데이터를 보고 판단해.
그래서 Sprite가 같다고 평가 조건이 같은 건 아니야.
34. Weapon은 화면에서 보여줘
Physical은 상세보기로 숨겨도 되지만 AI가 고른 Weapon은 전투에서 보여야 해.
왜냐하면:
“AI가 얘를 어떻게 키웠는지”
눈으로 보여주는 중요한 결과이기 때문이야.
같은 Warrior라도 Spear와 Axe가 다르게 보여야 해.
35. 애니메이션이 평가 점수를 바꾸면 안 돼
전투에서 멋있게:
- 움직이고
- 때리고
- 흔들리고
- 이펙트가 나와도
진짜 판정은 이미 Rule Engine과 Trace에서 끝난 거야.
AI 판단
↓
게임 판정
↓
Trace
↓
애니메이션으로 보여줌
반대로:
애니메이션 끝남
↓
그래서 AI 판단 실행
처럼 만들면 안 돼.
36. Inspector는 “새 이유 만들기”가 아니야
캐릭터가 보호 행동을 했으면 Inspector가 그 이유를 보여줘.
하지만 Inspector용 AI가 나중에 멋대로:
“가족을 생각해서 그랬습니다.”
같은 이유를 만들어 붙이면 안 돼.
Inspector는 이미 저장된:
- State
- Reason Code
- Decision
- Result
를 사람이 읽기 쉽게 보여주는 창이야.
37. UI 점수와 AI 점수는 따로 봐
게임이 예쁜 것도 중요해.
하지만:
UI가 예쁘니까 2B 모델이 좋은 모델
은 아니야.
그래서:
AI Evaluation
vs
Game/Visual QA
를 따로 관리해.
해커톤에서는 둘 다 보여주지만 Model 선정은 AI 지표로 한다.
38. 우리가 최종적으로 만들 화면
평가 관점에서 중요한 화면:
- Character Detail
- Battle
- Inspector
- Result
- AI Growth
- Camp Result
- Boss Fingerprint
- Evaluation Dashboard
이 화면들이 연결되면:
AI가 캐릭터를 실제로 키웠고, 우리가 그걸 측정했다
는 걸 한 번에 보여줄 수 있어.
39. Evaluation은 나중에 만드는 통계 페이지가 아니야
우리 차별점은 전투 그래픽만으로 안 끝나.
심사위원이 최종적으로 봐야 하는 건:
“그래서 작은 AI도 진짜 이 행동을 유지했어?”
야.
그래서 개발은:
게임 Vertical Slice
+
Evaluation Vertical Slice
를 같이 만든다.
40. P0 Evaluation 화면
최소:
Model Descent
8B PASS
4B PASS
2B PASS
1B FAIL
Heatmap
8B 4B 2B 1B
Build
Growth
MBTI
Camp
Replan
Retreat
Quality × VRAM
어떤 모델이 충분히 잘하면서 가장 가벼운지.
Camp Autonomy
같은 REST 명령을 줬을 때 모델별 10명 행동 분포가 어떻게 달라지는지.
Drill-down
왜 실패했는지 실제 Scenario와 Trace까지 들어간다.
41. 그래프 숫자는 무조건 실제 실험값
Evaluation 화면이 예뻐 보여도 가짜 숫자를 넣으면 안 돼.
실험 안 했으면:
NOT RUN
이라고 쓴다.
Mock은 개발용으로만 사용하고 발표 빌드와 섞지 않는다.
42. 에셋을 많이 만드는 게 평가 점수가 아니야
적 8종, 배경 18장을 만들어도 E4 점수는 안 올라가.
그래서 순서는:
게임처럼 보이는 핵심 전투
+
실제 평가 결과
↓
둘 다 확보
↓
추가 에셋
이다.
400개 이상 전체 Asset 체계는 미래 확장용이고 해커톤 필수 작업이 아니다.
43. 발표할 때 UI 레퍼런스 게임 이름은 말하지 않아
내부에서는 특정 게임을 참고할 수 있어.
외부에서는:
Character-first 2D auto-battle UI
라고 설명한다.
우리가 평가받아야 할 건 어떤 게임을 닮았느냐가 아니라:
- 실제 게임처럼 보이는가
- AI가 스스로 성장하는가
- 그걸 측정했는가
다.