AI 상대는 어떻게 키웠나, 그리고 세 번 틀린 이야기

2026년 09월 07일

AI는 엔진이 열거한 합법 수마다 점수를 매겨 최고점을 고릅니다. 가중치 38개가 룰북의 점수 공식(수입 3점, 주식 −3점, 링크 타일)을 근사하고, 그 위에 카네기와 밴더빌트라는 성격 2종이 얹힙니다.
세 번 틀렸습니다. 3주 동안 배포한 학습 결과가 사람에게 한 번도 닿지 않았고, 진화는 경매를 포기하는 쪽으로 수렴했고, 작은 표본에 세 번 속았습니다.
지금 성적: 운영자 제외 341판에서 사람이 1위 91%. AI 평균 점수는 7월 2.4점에서 9월 22점으로 올랐지만 사람을 이기지는 못합니다. 루프는 오늘 밤도 돕니다.

이 사이트의 상대는 사람이 아니라 코드입니다. 그 코드가 어떻게 지금 모습이 됐는지, 성공보다 실패를 중심으로 적습니다. 실패가 더 많이 가르쳤기 때문입니다.

구조: 엔진이 열거하고, AI는 고른다

이 구현의 엔진은 매 순간 둘 수 있는 합법 수를 전부 열거합니다. AI는 그중에서 고르기만 합니다. 그래서 AI는 불법 수를 둘 수 없고, 주사위와 큐브 뽑기가 전부 시드로 결정되기 때문에 같은 판을 언제든 다시 돌릴 수 있습니다. 이 두 가지가 뒤에 나오는 모든 측정의 바탕입니다.

고르는 기준은 가중치 38개의 합입니다. 내 링크로 배송하면 수입 1이 오르고 그게 3점이니 3.0, 상대 링크를 지나면 상대에게 3점을 주니 −1.2, 첫 턴에 타일 3개로 도시를 잇는 정석에 6.0, 미완성 지선을 흩뿌리는 버릇에 −3.5. 이런 식입니다. 그 위에 성격 2종이 얹힙니다. 밴더빌트는 안전 마진 2, 카네기는 4. 그 차이 하나로 1턴에 밴더빌트는 3주를, 카네기는 2주를 발행합니다.

러스트벨트 1턴 행동 선택 화면. AI 상대들이 철도 기술자, 기관차, 도시화를 이미 가져간 상태
1턴 행동 선택. AI 셋이 각자의 가중치로 액션을 먼저 골라 갔습니다.

학습: 매일 밤 도는 진화

7월 5일, 첫 셀프플레이 아레나가 돌았습니다. 챔피언 가중치를 흔들어 변이를 만들고, 같은 시드에서 자리를 돌려 가며 붙여, 승률과 평균 점수에서 파산율을 뺀 적합도로 겨루게 했습니다. 2세대 챔피언의 승률은 41.7%였는데 표본이 36판이라 그대로 동결했습니다. 100판 미만으로는 교체하지 않는다는 규칙이 그날 생겼습니다.

7월 7일, 한 방문자가 긴 피드백을 남겼습니다. 경매에서 아무도 안 지르고, 선로를 흩뿌리고, 1등이 90점일 때 2등이 10점이다. 코드를 고치는 대신 먼저 그 증상을 숫자로 재현하는 지표를 만들었고, 그 지표로 게이트를 세웠습니다. 그 뒤로 맥미니에서 매일 밤 진화 세 갈래가 돌고, 아침 6시에 홀드아웃 리그가 현행 챔피언과 붙여 네 가지 기준(적합도, 파산율, 승률, 완주율)을 넘으면 자동 배포합니다. 두 달 동안 자동 배포 10회.

첫 번째 실패: 3주의 학습이 사람에게 닿지 않았다

8월 1일, 사람이 둔 103판을 AI에게 다시 두게 해서 사람의 결정과 얼마나 일치하는지 재던 중에 이상한 걸 봤습니다. 실전에서 AI 평균 점수가 3.2점, 중앙값 0, 파산 34%. 셀프플레이 리그에서는 62점이었습니다. 원인은 학습이 아니라 배선이었습니다. 게임 화면이 AI 좌석마다 프리셋을 배정하고, 그 프리셋이 하드코딩된 옛 가중치로 학습 결과를 덮어쓰고 있었습니다. 야간 배포 5회가 전부 무효였고, 리그의 정체와 실전 성적은 서로 다른 정책을 보고 있었던 셈입니다.

고친 뒤 결과 분해를 다시 했습니다. 주식을 많이 발행해서 지는 게 아니었고(사람 10.4주, AI 11.9주), 수입이 문제였습니다. 사람 35.1 대 AI 11.4, 그리고 AI 수입은 6턴 이후 역성장했습니다. 그래서 건설 후보 상위 12개를 실제로 두어 보고 배송을 시뮬레이션하는 항을 넣었고, 배송 수 격차가 77% 줄었습니다. 실전 AI 평균 점수는 7월 2.4점에서 8월 20.5점이 됐습니다.

두 번째 실패: 경매를 포기하도록 진화했다

변이에 상한이 없었습니다. "순서 경매 패스" 가중치가 2.2에서 641로, 9월에는 3,221까지 폭주했습니다. 셀프플레이는 이걸 벌하지 못했습니다. 같은 정책끼리 붙으면 아무도 안 지르니 파산 7%로 평화롭고, 다른 정책과 붙이면 파산 32%. 사람이 입찰하는 지점의 66.6%에서 AI는 드롭했습니다. 7월과 8월에 서로 모르는 방문자 두 명이 같은 증상을 따로 보고했습니다. 근친 리그의 눈먼 곳이었고, 교훈은 한 줄입니다. 튜닝이 찾는 것은 최적이 아니라 국소 최소다.

세 번째 실패: 작은 표본에 세 번 속았다

8월 말, 게시판에 "AI가 정말 정말 못한다"는 글이 올라와 다른 종류의 AI를 같은 저울에 올렸습니다. 룰북을 조건문으로 옮긴 AI, 언어 모델에게 매 수를 묻는 AI, 한 판 내내 기억을 유지하는 언어 모델 AI. 파일럿 6판에서 67%가 나왔습니다. 24판으로 늘리니 45.8%. 다른 구성은 6판 중 4승이었다가 24판에서 39.6%. 보고서 원문에 "세 번째 소표본 낙관"이라고 적혀 있습니다. 표본을 충분히 모은 최종 결과는 이렇습니다.

AI승률판수비고
룰북 조건문6.1%99파산 82%
언어 모델, 무상태26.3%38귀무 33.3% 아래
휴리스틱 챔피언33% 언저리기준선
언어 모델, 한 판 기억 유지45.4%54p≈0.03, 판당 $4.6~13.9

결정 변수는 모델이 아니라 기억이었습니다. 그리고 도입 여부는 성능이 아니라 비용에서 갈렸습니다. 수익화하지 않는 무료 서비스에서 판당 수천 원짜리 상대는 쓸 수 없습니다. 그 실험 중에 API 잔액 $10이 빈 응답에 과금되며 하루 만에 사라지는 사고도 있었습니다.

지금 어디에 있나

지표
완주 판(운영자 제외)341
사람 1위91% (309판)
사람 파산6%
AI 평균 점수14.9 (파산 29%)
AI 평균 점수, 월별7월 2.4, 8월 19.8, 9월 22.3

2026-07-06부터 09-07까지 완주 기록. AI가 나아진 만큼 사람 승률도 올랐는데(84% → 93%), 같은 기간 유저층이 바뀐 영향을 아직 분리하지 못했습니다.

9월 초 진단은 더 불편했습니다. 3인 리그에서 파산 11%인 챔피언이 실전 4인에서는 50%였고(그래서 8월 25일부터 리그를 4인으로 바꿨습니다), 승격된 후보를 다시 재면 우위가 거의 사라졌습니다. 승격의 재현성이 0에 가깝다는 뜻이라, 지금은 같은 시드로 짝을 지어 검증하는 방식으로 고치는 중입니다.

참고한 논문은 86편이고, 그중 실제로 채택한 권고는 둘입니다. 사람 기보를 회귀 게이트로 쓸 것, 입찰은 차분 공식으로 계산할 것. 나머지는 대부분 이 게임 크기에서 과했습니다.

한 줄로

측정 없이 고치지 않는다. 그 규칙 때문에 느렸고, 그 규칙 덕분에 무엇이 틀렸는지 알 수 있었습니다. AI가 당신을 이기는 날이 오면 그 판의 시드와 함께 이 글에 추가하겠습니다.

이 글의 수치는 이 사이트의 운영 문서(AI 학습 로드맵, 사람 기보 리플레이 분석 2026-08-01, LLM 아레나 평가 2026-08-31, 야간 실험 로그)와 완주 기록 실측입니다. 운영자 계정은 제외했습니다.

AI와 한 판

다른 전략 글

Eagle-Gryphon Games 공식 스토어 페이지의 Age of Steam Deluxe Edition 제품 박스 이미지 원작을 만나보세요 Age of Steam Deluxe Edition 저작권자 John Bohrer, 발행 Eagle-Gryphon Games. 이 웹 구현은 원작 보드게임을 대신하지 않습니다. 공식 스토어에서 구매하기