Sol에서 Astra로,
무엇이 달라졌을까?
마지막 업데이트 2026-09-29
낯선 게임의 규칙을 더 잘 찾아내고, 알아낸 내용을 다음 행동까지 이어 쓰는 능력이 함께 중요해졌습니다.
더 잘 이해하는 모델 + 이어지는 기억
능력과 실행 환경의 역할을 설명하는 그림입니다. 두 효과의 기여율을 계산한 공식은 아닙니다.
“눌러 보고, 규칙을 찾고, 계획하기”
ARC-AGI-3는 설명서 없는 게임입니다. 목표와 작동 규칙을 직접 알아내야 합니다.
① 관찰: 출구 앞에 벽이 있고, 아래에 버튼이 있다.
처음에는 버튼과 벽의 관계를 모릅니다.
실제 Astra에서 무엇을 관찰했나?
ARC Prize는 물체·좌표·규칙·미완료 계획을 간결한 기호로 기록하는 행동을 관찰했습니다. ‘게임에 대한 작은 지도’를 만들어 계획하는 셈입니다. 이는 행동 분석이며 내부 신경망 구조를 밝혀낸 결과는 아닙니다. 관찰 원문
같은 Astra도, 기억 관리에 따라 점수가 달랐다
추론 상태도 이어받기
ARC-AGI-3 Semi-Private · 같은 추론 강도(high)끼리 비교. 점수는 인간 대비 행동 효율을 반영하며, 단순 정답률이나 속도 배수가 아닙니다.
조건과 수치를 더 자세히 보기
- Astra의 표준 환경 최고점은 max에서 62.7%, Adapter 최고점은 high에서 99.9%입니다. 위 그래프는 추론 강도를 high로 맞췄습니다.
- Sol도 공개 문제 세트에서 추론 보존·문맥 압축을 켜자 13.3% → 38.3%로 상승했습니다. 공개 세트와 Semi-Private 수치를 하나의 그래프로 합치지 않았습니다.
- 실행 환경의 개선은 확인되지만, 전체 향상을 기억·훈련·추론 능력 각각의 기여율로 분해한 실험은 아닙니다. 최고점이 일반 업무 성능을 보장하지도 않습니다.
게임의 규칙을 배우기 ≠ 자기 자신을 재훈련하기
문제 안에서 적응
현재 문제에 대한 이해를 문맥에 쌓습니다.
모델 재학습
훈련을 통해 모델의 매개변수를 바꿉니다.
재귀적 자기개선
ARC 점수만으로 이 과정을 입증할 수 없습니다.
위 세 가지는 개념 구분입니다. 평가 중 가중치 변경 여부에 대한 별도 실험 결과를 뜻하지 않습니다.
알려진 범위와 남아 있는 질문
OpenAI는 사전학습·강화학습·정렬 연구의 발전을 결합했다고 설명합니다. 구체적인 훈련 방법별 기여율이나 재귀적 자기개선으로 모델을 만들었다는 근거는 확인되지 않았습니다.
ARC Prize 역시 이 점수가 AGI의 증명은 아니며, 재귀적 자기개선과 열린 문제 해결은 향후 평가할 질문으로 남겨 둡니다.
출처 · 문서 범위
- ARC Prize: Astra 평가와 행동 분석 — 2026-09-03. 점수, 실행 환경, 기호 표현, 평가 한계.
- OpenAI: 두 설정이 ARC-AGI-3 점수에 준 영향 — 2026-07-29. Sol의 추론 보존과 문맥 압축 실험.
- OpenAI: Astra 출시와 평가 조건 — 훈련에 대한 공개 설명과 모델 비교.
2026-09-29 확인 자료를 바탕으로 작성한 참고 문서입니다. PPI 런타임 변경이나 자체 모델 실험을 보고하는 문서가 아닙니다. 도식의 게임은 설명용 가상 예시입니다.