BUILD LOG · 눈금을 바꾼 라운드

칸별 정확도 0.411로는 빈칸 약 56개짜리 한 판을 풀 수 없다 — 50%를 풀려면 약 0.988이 필요하고, 그래서 다음 표적은 정확도가 아니라 "언제 커밋할지"다.

이번 라운드의 산출물은 새 기록이 아니라 눈금의 교체다. 사전등록 P-SOLO(held-out n=2000·weakOOD n=300 전량 + 공식 test n=400)가 "생성기 단독 순기여" 행을 0으로 확정했고, 왜 0일 수밖에 없는지가 산술로 설명됐다.

다만 "매 스텝에 감독을 걸면 좋아진다"는 가정은 이미 기각됐다 — 매-스텝 정답 감독 성분만 떼어 재면 held-out −0.00595(홈 보정 p 1.0), weakOOD −0.00696(홈 보정 p 0.679)이다. 유의했던 유일한 성분은 스텝마다 다른 타깃을 주는 팔뿐이다(weakOOD +0.04888, 홈 보정 p 0.0044). → §5 카드 2
우리 칸별 정확도 · held-out n=2000
0.411
빈칸 하나하나를 따로 채점한 값(아무렇게나 찍으면 0.111). 한 판(빈칸 약 56)을 50% 풀려면 약 0.988이 필요하다 → §2
생성기만 푼 퍼즐 · 3표본 전부
0/2000 · 0/300 · 0/400
생성기가 푼 판은 전부 고전 전파도 푸는 판이었다. Clopper-Pearson 95% 상한 .0018 / .0122 / .0092 → §3
고전 완전 백트래킹 탐색의 천장
1.000 / 1.000
held-out 2000 · weakOOD 300 전량. 값도 싸다(퍼즐당 평균 6,623 / 512회 시도). 그래서 스도쿠는 이기려는 무대가 아니라 학습된 자가 제대로 재는지 검증하는 계측기다 → §1
§0

정정 원장 — 지금 무효인 과거 주장 3건

새 숫자를 읽기 전에

이 사이트는 지금까지 헤드라인 주장 세 건을 철회했다. 셋 다 원인이 같다 — 비교 대상을 잘못 골랐다. 무슨 프로젝트인지는 바로 아래 §1에 있다.

언제무엇을 주장했나무엇이 뒤집었나지금 상태
07-06 모델이 "어느 칸을 먼저 시도할지" 고르면 검색이 빨라진다고 주장했다 (기록 0.865) 분기 순서를 고전 최소잔여값 휴리스틱으로 통째 교체해도 0.865. 예산별 차이 5개 전부 신뢰구간이 0을 포함 철회
07-19 검색 없는 조건에서 학습 게이트가 전파 단독을 앞선다 (+0.0450, one-sided 95% 하한 +0.0250) 학습을 0회 쓰는 고전 단일-호 일관성 룩어헤드(SAC-lite) 팔이 0.1353으로 학습 게이트 0.0677의 두 배. 정정된 주 추정량 −0.0677, 하한 −0.0902 철회 → 정정 배너
07-14 자-교사 증류가 헤드라인 게이트(>0.5)를 통과했다 (0.785 / 0.594) 발사 스크립트가 선언한 게이트 문언대로 계산하면 held-out +0.000, weakOOD 정의 불능(분모 0) 조건부 (칸별 정확도 눈금에서만 성립) → §4

근거: 1행 INSIGHTS.md:926-960 · 2행 INSIGHTS.md:1469-1505, five_arm.json · 3행 INSIGHTS.md:1693-1740, docs/CONSTITUTION.md §7

§1

우리가 무엇을 하려 했나

처음 보는 사람을 위한 네 문장

우리는 데이터를 인위적으로 불리지 않고(무증강), 적은 예제만으로 재귀 모델이 유일해 문제를 푸는 법을 찾으려 했다. 그 방법의 핵심은 자(ruler)를 따로 학습시켜, 답이 아니라 "지금 상태가 정답에서 얼마나 떨어져 있는가"를 재게 하는 것이다. 자가 잰 값은 보상 점수가 아니라 매 스텝의 조밀한 학습 타깃으로 생성기에 증류되고, 실제 추론은 생성기 혼자 한다. 스도쿠는 손으로 만든 자가 이미 존재해서 학습된 자를 검증할 수 있는 관문일 뿐이고, 진짜 표적은 손 자가 없는 ARC와 결정 구조(크리스탈)다.

§2

오늘의 중심 발견 — 칸별 정확도로는 한 판이 풀리지 않는다

p의 56제곱 논증

스도쿠 한 판의 빈칸은 평균 약 56개다(모집단 단서 25.28개, 81 − 25.28 = 55.72). 칸별 정확도 p가 칸마다 독립이라면 한 판을 통째로 맞힐 확률은 p의 56제곱이고, 절반을 풀려면 p ≈ 0.988이 있어야 한다. 우리 모델의 칸별 정확도는 held-out에서 0.411이다 — 이 지점에서 정확도를 한 칸씩 올려 해결률 절반에 닿으려면 오답률을 0.589에서 0.0123까지, 약 48배 줄여야 한다. 우리가 지금까지 관측 채널 하나를 붙여 얻은 개선폭은 0.341 → 0.411, 오답률로는 1.2배 축소였다. 고전 전파가 푸는 이유도 정확도가 높아서가 아니라 규칙이 강제한 칸에서만 적어 넣기 때문이다(정밀도 1.0, 낮은 커버리지).

유도 — 세 줄

빈칸 = 81 − 단서 25.28 ≈ 56
P(한 판 정답) = p56   (칸마다 독립일 때)
p = 0.51/56 = 0.9877 ≈ 0.988   ← 절반을 풀기 위한 값

FIG A · 벽의 위치(왼쪽)와 벽까지의 거리(오른쪽)

0 0.5 1.0 0.300.651.00 칸별 정확도 p (선형) 예상 해결률 = p^56 우리 0.411 예상 해결률 ≈ 0 필요 0.988 해결률 0.5 이 구간 전체가 해결률 0 근처
1 1e-5 1e-10 1e-15 1e-20 ↓ 해결률 정확히 0 (로그 축 밖의 전용 띠) 0.100.501.00 칸별 정확도 p (해결률은 로그 눈금) 곡선 예측 2.4e−22 이 간격이 20자릿수 — 캐비앗이 그 이유를 설명한다 실측 0.411 → 해결률 0.022 실측 0.111(무작위 초기화) → 0 실측 0.341(관측 채널 끔) → 0 0.90 0.988→0.5

왼쪽은 벽이 어디 있는지, 오른쪽은 우리가 벽에서 얼마나 떨어져 있는지를 보여준다. 오른쪽의 붉은 점 세 개는 이상화가 아니라 같은 모델의 실측이다(무작위 초기화 0.111 → 해결률 0, 관측 채널 끔 0.341 → 0, 전체 0.411 → 0.022). 실측 0은 로그 축에 없으므로 하단 "0" 전용 띠에 얹었다.

이 곡선은 왜 20자릿수나 빗나가는가 — 그리고 그래도 남는 것

곡선은 칸마다 오류가 독립이라고 가정하지만 실제 오류는 뭉쳐 있고(틀린 커밋의 96%가 "규칙에는 맞지만 전역 오답", INSIGHTS.md:1276), 무엇보다 생성기가 실제로 푸는 퍼즐은 모집단이 아니다 — 생성기가 푼 44판의 평균 단서는 33.86개로 모집단 25.28개보다 8.6개 많다. 즉 빈칸이 56개가 아니라 47개인 쉬운 층만 푼다.

그래도 곡선이 말해주는 것은 남는다. 해결률은 칸별 정확도에 대해 극단적으로 볼록하다 — 어떤 가정을 쓰든, 절반을 풀려면 칸별 신뢰도가 거의 완전에 가까워야 한다. 우리는 그 자리에서 아주 멀고, 지금 속도(관측 채널 하나로 오답률 1.2배 축소)로는 48배에 닿지 않는다. 그래서 §6은 정확도를 올리는 길이 아니라 다른 길을 고른다.

§3

생성기가 푼 것은 고전 전파가 이미 푸는 것 안에 있었다

사전등록 P-SOLO

held-out 2000판에서 생성기가 단발로 푼 것은 44판, 고전 전파(naked + hidden single)가 푼 것은 236판이다. 그런데 생성기가 푼 44판은 전부 고전이 푸는 236판 안에 있었고, 반대는 하나도 없었다 — 생성기만 푼 퍼즐은 held-out 0/2000, weakOOD 0/300, 공식 test 0/400으로 세 표본 전부 0이다(집합으로 말하면 진부분집합이다). 그 44조차 손 위반-관측 채널이 만든다 — 이 채널을 끄면 해결률이 정확히 0으로 떨어진다.

손 위반-관측 채널 — 현재 상태에 규칙 위반(같은 줄·칸에 같은 숫자)이 있는지 사람이 짠 코드로 검사해 그 결과를 모델 입력에 넣어주는 통로다. 학습된 것이 아니라 우리가 손으로 붙인 것이다.

FIG B · 벤 다이어그램 — 메시지는 초승달이 아니라 바깥이다

고전 naked+hidden 전파 · 236 / 2000 생성기 단발 44 / 2000 고전만 푼 것 192판 여기가 비어 있다 생성기만 푼 퍼즐 0판 CP95 상한 .0018 weakOOD 0 / 300 (상한 .0122) 공식 test 0 / 400 (상한 .0092)

원의 넓이는 푼 퍼즐 수에 비례한다. 작은 원이 큰 원 안에 완전히 들어가 있다는 것이 오늘의 결과다 — 생성기가 푼 44판은 전부 고전 전파도 푸는 판이었고, 그 반대(생성기만 푼 판)는 0판이다. 같은 퍼즐 단위로 하나씩 대조한 결과다.

아래 표에서 눈으로 확인할 것은 한 가지다: 생성기 행의 가장 큰 수(0.0220)가 고전 행의 가장 작은 수(0.0280)보다도 작다.

팔 — 추론 단독 성능 (사전등록 P-SOLO)held-out (n=2000)weakOOD (n=300)공식 test (n=400)
생성기 단발 (손 위반-관측 채널 포함)0.0220 [.0160,.0294]0.0000 [0,.0122]0.0150
생성기 단발 · 잡음 마지널 8회0.0215 [.0156,.0289]0.0000
생성기 단발 · 관측 채널 끔0.0000 [0,.0018]0.0000
생성기 단발 · 무작위 초기화 가중치0.0000 (칸별 0.1107)0.0000
8라운드 재정련 / 8개 중 최선0.0000 / 0.00000.0000 / 0.0000
고전 naked-single 전파0.0280 [.0212,.0362]0.0100 [.0021,.0289]
고전 naked + hidden 전파0.1180 [.1042,.1330]0.4267 [.3700,.4848]0.1375 (합집합)
고전 완전 백트래킹 탐색1.0000 [.9982,1.0]1.0000 [.9878,1.0]
표 각주 (출처·조건)

구간은 Clopper-Pearson 95%. 체크포인트 teach_m2final.pt (sha1 848c4c0b58fa), K=6, 학습 없음(backward 0회). 출처: autoresearch/order_mdl-260711/psolo.json · psolo.log. 공식 test n=400 열은 psolo.json에 없고 실험일지 기록(INSIGHTS.md:1653-1667)이 출처다 — 재산출된 값이 아니다.

§4

선언된 눈금과 채택된 눈금이 다른 물건이었다

같은 체크포인트, 두 계산

회복 비율 — "자로 가르쳤을 때의 개선폭 ÷ 손 교사로 가르쳤을 때의 개선폭". 손 교사가 아무것도 개선하지 못하면 분모가 0이 되어 비율 자체가 정의되지 않는다 — 해결률로 재면 정확히 그 일이 일어난다(모든 교사 팔이 0.000, 손 교사만 0.0100).

헌법의 헤드라인 지표는 자-교사 증류의 회복 비율이고, 원장에는 0.785 / 0.594로 "통과"라고 적혀 있다. 그런데 발사 스크립트가 선언한 판정식을 그 문언 그대로 계산하면 held-out +0.000, weakOOD는 분모가 0이라 정의조차 되지 않는다. 같은 체크포인트·같은 데이터인데 판정이 뒤집히고, 차이는 전부 분자(자 vs 증류)와 지표(해결률 vs 칸별 정확도)의 선택에서 온다 — 그 선택은 발사 후에 이뤄졌다.

아래 표에서 볼 것: 1행과 2행은 같은 체크포인트다. 갈리는 것은 판정식의 분자와 지표뿐이다. 3행(무작위 교사 +0.157)이 통제군이다 — 이 값 아래는 교사 내용의 공이 아니다.

계산분자지표held-outweakOOD게이트 >0.5
발사 스크립트가 선언한 식자 − 없음해결률+0.000정의 불능 (0/0)미달
원장에 채택된 식증류 − 없음칸별 정확도+0.785+0.594통과
(참조) 무정보 통제 · 무작위 교사증류 − 없음칸별 정확도+0.157+0.077
(참조) 정답 one-hot 교사증류 − 없음칸별 정확도−0.602−0.490
(참조) 거리-등급 교사증류 − 없음칸별 정확도+0.006−0.060

n=100, 2026-07-14 체크포인트를 2026-07-26에 학습 없이 재산출. 근거: INSIGHTS.md:1704-1728 · docs/CONSTITUTION.md §5·§7 · stage_g_teach.sh:4-5

FIG C · 같은 체크포인트, 두 눈금 — 가운데 세로선에서 단위가 바뀐다

+1.0 0 −0.5 게이트 0.5 ← 여기서 눈금이 바뀐다 → 단위: 해결률 (선언된 식) 단위: 칸별 정확도 (채택된 식) +0.000 held-out 정의 불능 weakOOD · 분모 0 +0.785 held-out +0.594 weakOOD +0.157 무정보 통제 (무작위 교사) ↑ 이 점선 아래(+0.157)는 교사 내용에 귀속할 수 없다 — 아무 내용 없는 무작위 교사도 여기까지 온다. 0.785 중 교사 내용의 몫은 이 표만으로 미식별.

두 막대군은 같은 체크포인트·같은 데이터에서 나왔다. 다른 것은 분자와 지표뿐이고, 그 선택은 발사 후에 이뤄졌다. 왼쪽 눈금(해결률)과 오른쪽 눈금(칸별 정확도)은 단위가 다르므로 높이를 서로 비교하면 안 된다 — 그 비교 불가능성 자체가 이 그림의 주제다.

§5

감사가 찾아낸 구현 결함

코드 실측

위 결과들과 별개로, 코드 자체를 실측한 감사에서 설계 가정과 구현이 어긋난 자리 세 곳이 나왔다. 셋 다 "돌아가긴 하는데 우리가 믿던 것을 재고 있지 않았다"는 형태다.

먼저 — 이 모델이 한 번에 하는 일

이 모델은 한 방에 답을 쓰지 않는다. 판 전체의 상태를 담은 내부 표현을 하나 두고, 그것을 여러 번 고쳐 쓴 다음(바깥 반복 K회, 우리는 K=6) 마지막 표현을 숫자판으로 읽어낸다.

학습할 때 "어디에 채점을 하느냐"가 갈린다 — 마지막 표현 하나만 채점하면 끝점 감독, 여섯 번 전부 채점하면 매-스텝 감독이다.

바깥 반복 한 번 안에도 더 잘게 도는 안쪽 반복(L-스텝)이 있는데, 거기에 채점을 건 파일은 저장소에 하나도 없다 — 그게 §6 카드 2가 말하는 "미검정 축"이다.

FIG D · 감독이 걸리는 자리 — 바깥 반복 6번, 안쪽 반복, 그리고 채점 화살표

매-스텝 감독: 여섯 스텝 전부 채점 · 3파일 끝점 감독: 마지막 하나만 · 10파일 z1z2z3 z4z5z6 ↑ 안쪽 반복 L-스텝 — 여기에 채점을 건 파일: 저장소에 0개 (미검정 축 → §6 카드 2) 읽어내기(decode)는 어느 z에서든 같은 함수다 — 감독의 차이는 "어느 z를 채점하느냐"의 선택이다.

1 · 중간 스텝은 학습되지 않았다

롤아웃 뒤 끝점 하나에만 손실을 거는 트레이너에서, 앞의 K−1 스텝이 그래디언트에 기여하는 양은 정확히 0이다. 앞 K−1 스텝을 학습 차단으로 감싼 것과 14개 파라미터 전부가 비트 단위로 같았다(최대 절대차 0.000e+00). ARC와 크리스탈 트레이너가 이 형태다.

PREREG_S2.md:16 · gram.py:378-400 · arc_gram_train.py:262-266 · crystal_s0_train.py:203-209

2 · 그런데 "매-스텝"이 레버는 아니다

최소차이 대조에서 매-스텝 정답 감독 성분만 떼어 재면 held-out −0.00595(홈 보정 p 1.0), weakOOD −0.00696(홈 보정 p 0.679)로 효과 없음이다. 유의했던 유일한 성분은 스텝마다 다른 타깃을 주는 팔(weakOOD +0.04888, 홈 보정 p 0.0044). 그러니 카드 1은 "고쳐야 할 버그"가 아니라 "비어 있는 자리"의 확인이다. 같은 타깃으로 그 자리를 채우는 것은 이미 무효로 판명됐고, 남은 가능성은 스텝마다 타깃이 달라질 때뿐이다 — §6 카드 2가 그 축이다.

judge_wave1.json (heldout/a0t-a0 · weakOOD/a0t-a0 · weakOOD/a1-a0)

3 · 암기 견제 장치가 ARC에 하나도 없다

ARC에서 모델은 학습 때 본 시연 쌍은 0.9877로 그대로 되뇌지만 같은 과제의 새 입력은 0.012만 맞힌다 — 외운 것이다. 재귀 깊이를 1·2·4·6으로 바꿔도 test 내용 일치는 0.644~0.671로 움직이지 않는다. 헌법이 처방한 압축 견제 세 갈래(파라미터·손상·잠재) 중 ARC 트레이너에 적용된 것은 0건, 명령줄 인자에도 손상·용량·감쇠 옵션이 0개다.

INSIGHTS.md:823-847 · arc_gram_train.py (grep) · CONSTITUTION.md §2:66-74

아래 표에서 볼 것: 지금까지의 판정 대부분(10/16)이 "끝점 하나" 조건에서 내려졌고, 마지막 행의 자리는 아직 아무도 시험하지 않았다.

활성 트레이너 16개의 감독 입도 (실측)파일 수
끝점 하나10롤아웃이 끝난 뒤 마지막 상태에만 손실
롤아웃 스텝마다3바깥 반복의 각 스텝에 손실
동결 테스트타임 적응2가중치 동결, 잠재만 적응
해당 없음1
마지막 사이클 안쪽 L-스텝0저장소에 한 파일도 없다 = 미검정 축

각 트레이너 상단에 삽입된 SUPERVISION 선언을 집계했다. 집행 게이트는 scripts/g0_constitution_gate.py이며 현재 FAIL 0 / WARN 2 = PASS(활성 트리 54파일 검사).

§6

그래서 다음에 무엇을 하는가

눈금 이동 + 미검정 축

칸별 정확도를 올리는 길은 §2가 닫았고, 매-스텝 감독을 늘리는 길은 §5 카드 2가 닫았다. 남은 것은 커밋 결정 — 언제 적어 넣고 언제 참을지 — 을 학습 대상으로 삼는 것이다. 다만 커밋 결정만으로는 부족하다 — 커밋 정밀도가 1.0인 고전 전파조차 held-out 0.118에서 멈추기 때문이다. 천장을 뚫는 것은 틀린 커밋을 되돌릴 수 있는 검색이고(고전 완전 백트래킹 1.000), 학습된 자가 기여할 자리는 그 검색이 어디를 먼저 열지 정하는 곳이다. 그리고 그 자리는 이미 한 번 뒤집혔으므로(§0 2행), 다음 라운드는 고전 통제군을 같은 표에 넣지 않으면 발사하지 않는다.

§7

다음 라운드의 반려 규칙 (사전등록 초안)

하나라도 어기면 발사 전에 반려한다
  1. 고전 통제군 필수. 학습 성분을 주장하는 모든 표에는 그 성분이 흉내 내는 고전 알고리즘 팔이 같은 데이터·같은 예산으로 들어가야 한다. 근거: 세 번의 뒤집힘 전부 이 통제군 부재였다 — INSIGHTS.md:926, :1469, :1635
  2. 매-스텝 감독을 근거로 삼지 않는다. "스텝마다 감독을 걸어서 좋아진다"는 가정은 기각됐다(held-out −0.00595, weakOOD −0.00696). 주장하려면 타깃이 스텝마다 다르다는 것이 설계에 명시돼야 한다. 근거: judge_wave1.json 최소차이 대조 (a0t-a0 무효 · a1-a0만 유의)
  3. 칸별 지표를 헤드라인으로 쓰지 않는다. p의 56제곱 논증에 따라 칸별 정확도는 해결률의 대리 변수가 아니다. 칸별 값은 진단 채널로만 보고한다. (커밋 정밀도는 여기서 말하는 칸별 지표가 아니다 — 분모가 모든 빈칸이 아니라 모델이 적기로 선택한 칸이기 때문이다.)
  4. 판정식은 발사 전에 코드에 박제한다. 발사 스크립트가 선언한 문장과 헌법 §5의 정의가 문자 그대로 일치하는지 발사 전 감사 항목에 포함한다. 근거: 2026-07-26 사후 지표 이동 사례 (§4)
§8

전체 실험사 타임라인

2026-06-26 → 2026-07-26 · 28항목

배지 3종 — 생존(주장이 지금도 유효) · 사멸(접근 자체가 죽음) · 정정(당시 주장이 나중에 뒤집히거나 강등됨). 판정은 항목의 현재 상태 기준이다.

1막 · 에너지 시대 (06-26 → 07-08)

06-26사멸

에너지를 −∇E로 하강해 답에 이르는 경로 — 검증기는 완벽하나(AUC 1.0) 항해 불가, 여덟 번의 레버 전부 실패. ../index.html:124

06-28정정

스텝마다 감독을 거는 학습이 끝점 학습을 이김(0.24 → 0.41 OOD). 단 07-17 최소차이 대조에서 "매-스텝" 성분 단독은 무효로 판명 — 살아남은 것은 스텝-상이 타깃뿐. judge_wave1.json

07-02생존

정답 없이 손 에너지만으로 가르쳐도 일반화 — held-out 0.47 > 정답으로 가르친 0.296. ../index.html:136

07-04생존

에너지를 그래디언트가 아니라 관측 채널로 넣으면 처음으로 순기여. ../index.html:142

07-05생존

연산자 학습 — held-out 정확일치 0 → 0.09. ../index.html:148

07-06정정

자×생성기 검증 검색으로 0.31 / 0.75 기록. 07-20 최소잔여값 대조에서 신경 순서의 몫이 사라짐. INSIGHTS.md:926

07-08사멸

학습된 스칼라 에너지를 검색 가치·보상·잠재 이동에 쓰는 세 자리 전부 실패. ../index.html:160

2막 · 자(ruler) 시대 (07-11 → 07-18)

07-11정정

1스텝 규칙 무대는 전 팔 F1 ≈ 1.0으로 포화 — 판별력이 없어 k스텝 무대로 교체. ../index.html:166

07-12생존

자가 학습됐다 — k스텝 legal-F1 0.993, 순서 불변성 최상. ../index.html:172

07-12사멸

그러나 자를 손 규칙 자리(하드 후보 프루닝)에 앉히면 해결률 ≈ 0 — 참 숫자 12%를 떨어뜨린다. ../index.html:178

07-14정정

자-교사 증류 회복 비율 0.785 / 0.594 "통과" → 07-26에 칸별 정확도 조건부로 강등 (§0 3행·§4). CONSTITUTION.md §7 · INSIGHTS.md:1704

07-15생존

손상 패턴을 여러 개로 늘리는 압축(손상-MDL)이 +9pp, 잠재 압축을 끄면 붕괴 = 인과 증거. CONSTITUTION.md §7 (0714-15)

07-15사멸

정답 one-hot을 교사로 쓰는 증류 — 회복 비율 0.18, "잡음 지향"의 확정 실패. CONSTITUTION.md §7 rung-2

07-17생존

무증강 재귀 스도쿠 9실험 종합 — 벽은 표현력이 아니라 커밋 정밀도, 해는 가역 검색. INSIGHTS.md:382-420

07-17생존

최소차이 대조: 매-스텝 정답 감독 무효(−0.00595 / −0.00696), 스텝마다 다른 타깃만 유의(weakOOD +0.04888, 홈 보정 p 0.0044). judge_wave1.json

07-18생존

공식 벤치마크 — 무증강 54.5% [47.5, 61.5], 증강 의존 계층 재귀(HRM) ~55%와 동급. 단 이 수치는 검증기 + 가역 검색의 산물이다. INSIGHTS.md:666-676

07-18생존

결정 구조를 86토큰 이산 캔버스로 인코딩, 왕복 복원 보존 1.000 — 세 도메인이 한 레시피로 통일. INSIGHTS.md:686-696

3막 · 통제군 시대 (07-19 → 07-26)

07-19사멸

ARC 무증강 생성: 시연 쌍 0.9877 재현, 같은 과제 새 입력 0.012 — 외운 것. 재귀 깊이 무익(K=1/2/4/6에서 내용 0.644~0.671). INSIGHTS.md:823-847

07-19정정

"안전 커밋 계층 발견" — 상위 2%에서 정밀도 0.995. 그러나 전파 특징만으로 0.982, 학습 몫은 +0.0136 [+0.0000, +0.0315]. INSIGHTS.md:1307-1318

07-19사멸

검색 없는 조건 end-to-end 확증 +0.0450 (하한 +0.0250) → 07-20 철회. INSIGHTS.md:1361-1395

07-20사멸

신경 분기-순서 대조: 최소잔여값 휴리스틱으로 교체해도 0.865 동일, 예산별 차이 5개 전부 신뢰구간 0 포함. INSIGHTS.md:926-960

07-20사멸

5팔 사전등록: 학습 0회의 고전 단일-호 일관성 룩어헤드(SAC-lite) 0.1353 vs 학습 게이트 0.0677. 주 추정량 −0.0677, 하한 −0.0902. five_arm.json · INSIGHTS.md:1469

07-20사멸

크리스탈 이식 주장 철회(fold 아티팩트) + 귀속 절단 사전등록도 (c) 사멸. INSIGHTS.md:1431 · :1509

07-20생존

고전 천장 사다리 — 1단 룩어헤드에서 0.135로 포화. INSIGHTS.md:1537

07-24사멸

크리스탈 2×2 사전등록: 잠재 압축 주효과 −0.0270, 손상복구 주효과 −0.0090 — 헌법의 중심 가설(압축이 증강의 대체물) 기각. prX_verdict.json · INSIGHTS.md:1597

07-26사멸

P-SOLO — 생성기 단독 순기여 0. 생성기가 푼 판은 전부 고전 전파도 푸는 판이었다(생성기만 푼 것 3표본 전부 0). psolo.json · INSIGHTS.md:1635

07-26정정

선언된 눈금 +0.000(정의 불능) vs 채택된 눈금 +0.785 — 이 프로젝트 최초로 문서화된 사후 지표 이동. INSIGHTS.md:1693

07-26생존

헌법 기계 게이트 신설(FAIL 0 / WARN 2 = PASS, 활성 트리 54파일) + 활성 트레이너 16개에 감독 입도 선언 삽입. scripts/g0_constitution_gate.py

11
생존
11
사멸
6
정정
§9

용어 카드

처음 읽는 사람을 위해

1 전파

한 칸이 정해지면 같은 줄·칸의 후보가 줄어드는 연쇄를 더 줄어들 것이 없을 때까지 밀어붙이는 것. 추측은 하지 않고 규칙이 강제하는 부분만 채운다. 그래서 정밀도는 1에 가깝고 커버리지는 낮다.

2 커밋 — 그리고 두 지표의 차이

한 칸에 숫자를 확정해 적는 행위. 칸별 정확도는 빈칸 전부를 분모로 삼는다. 커밋 정밀도는 모델이 스스로 적기로 한 칸만 분모로 삼는다. 이 차이가 오늘의 전환점이다 — 56칸을 모두 적으면서 41%만 맞히는 것과, 5칸만 적으면서 99%를 맞히는 것은 전혀 다른 물건이다. 커밋은 되돌리지 않으므로 틀린 커밋 하나가 판 전체를 죽인다. 몇 칸을 적을지가 커버리지, 그중 몇 개가 맞는지가 정밀도다 — "정밀도@커버리지"는 이 둘을 짝지어 읽는다는 뜻이다.

3 칸별 정확도

빈칸 하나하나를 따로 채점한 값. 분모는 그 퍼즐의 빈칸 전부(평균 약 56칸), 분자는 정답 숫자를 맞힌 칸 수다. 한 칸은 1~9 중 하나이므로 아무렇게나 찍으면 0.111이 나온다(실측: 가중치를 무작위로 되돌리면 0.111). 우리 값 0.411은 찍기의 약 네 배다. 그러나 이 지표는 한 판이 풀렸는지는 말해주지 않는다 — 그게 §2의 주제다.

4 자(ruler)

답을 가리키는 장치가 아니라 지금 상태가 정답에서 얼마나 떨어졌는지를 재는 장치. 잰 값은 점수가 아니라 학습 타깃으로만 쓰고, 실제 추론에는 쓰지 않는 것이 우리 설계다.

5 무증강

같은 문제를 회전·치환·재라벨로 불려 데이터를 늘리지 않는 것. 선행 연구는 샘플당 약 1000배 증강에 의존하는데, 우리 주장은 압축이 그 증강을 대신할 수 있다는 것이었다(2026-07-24에 첫 직접 시험에서 기각됨).

6 사전등록

결과를 보기 전에 판정식·표본 크기·성공 기준을 문서와 코드에 못 박는 절차. 오늘 P-SOLO는 판정 규칙을 실행 파일 상단에 박제한 상태로 돌렸다.

7 통제군

주장하려는 성분을 팔. 학습 성분을 주장할 때는 그 성분이 흉내 내는 고전 알고리즘 팔이 통제군이다. 이 사이트의 헤드라인은 통제군 누락으로 세 번 뒤집혔다.

MatterGPT_RL build log · 2026-07-26 · 모든 수치는 psolo.json · judge_wave1.json · five_arm.json · INSIGHTS.md · CONSTITUTION.md 파일:줄 근거를 병기 back to overview