ELI5 · AI를 이해하는 그림

Sol에서 Astra로,
무엇이 달라졌을까?

마지막 업데이트 2026-09-29

낯선 게임의 규칙을 더 잘 찾아내고, 알아낸 내용을 다음 행동까지 이어 쓰는 능력이 함께 중요해졌습니다.

2026-09-29 · 비교 대상: GPT-5.6 Sol → GPT-6 Astra · 공개 자료 해설

01 / 전체 그림

더 잘 이해하는 모델 + 이어지는 기억

규칙 발견 · 계획무엇이 어떻게 움직일까?
+
추론 상태 보존지난 발견을 이어 쓰자
→
적은 시행착오새 게임에서도 계획 실행

능력과 실행 환경의 역할을 설명하는 그림입니다. 두 효과의 기여율을 계산한 공식은 아닙니다.

확인되지 않은 것: Astra가 재귀적 자기학습으로 만들어졌다는 주장과 내부 신경망의 특별한 ‘루프’ 구조.
02 / 발견을 쌓는 루프

“눌러 보고, 규칙을 찾고, 계획하기”

ARC-AGI-3는 설명서 없는 게임입니다. 목표와 작동 규칙을 직접 알아내야 합니다.

가상 예시 · 실제 평가 재현 아님

① 관찰: 출구 앞에 벽이 있고, 아래에 버튼이 있다.

처음에는 버튼과 벽의 관계를 모릅니다.

관찰 · 실험
→
규칙 정리
→
계획 · 실행
↻ 결과를 확인하고, 다음 행동에 반영
실제 Astra에서 무엇을 관찰했나?

ARC Prize는 물체·좌표·규칙·미완료 계획을 간결한 기호로 기록하는 행동을 관찰했습니다. ‘게임에 대한 작은 지도’를 만들어 계획하는 셈입니다. 이는 행동 분석이며 내부 신경망 구조를 밝혀낸 결과는 아닙니다. 관찰 원문

03 / 기억을 전달하는 방식

같은 Astra도, 기억 관리에 따라 점수가 달랐다

Standard · 표준 환경

선택한 메모를 전달

이번 추론
→
메모
→
다음 행동
내부 추론 상태는 그대로 이어지지 않음
Provider Adapter · 제공사 기능 활용

추론 상태도 이어받기

이번 추론
→
상태 보존
→
다음 행동
긴 문맥은 압축해 계속 진행
Astra · high · Standard54.8%
Astra · high · Provider Adapter99.9%

ARC-AGI-3 Semi-Private · 같은 추론 강도(high)끼리 비교. 점수는 인간 대비 행동 효율을 반영하며, 단순 정답률이나 속도 배수가 아닙니다.

7.8 → 99.9를 모델 능력의 차이로만 읽으면 안 됩니다. 앞 숫자는 Sol의 표준 환경, 뒤 숫자는 Astra의 Provider Adapter 결과입니다.
조건과 수치를 더 자세히 보기
  • Astra의 표준 환경 최고점은 max에서 62.7%, Adapter 최고점은 high에서 99.9%입니다. 위 그래프는 추론 강도를 high로 맞췄습니다.
  • Sol도 공개 문제 세트에서 추론 보존·문맥 압축을 켜자 13.3% → 38.3%로 상승했습니다. 공개 세트와 Semi-Private 수치를 하나의 그래프로 합치지 않았습니다.
  • 실행 환경의 개선은 확인되지만, 전체 향상을 기억·훈련·추론 능력 각각의 기여율로 분해한 실험은 아닙니다. 최고점이 일반 업무 성능을 보장하지도 않습니다.
04 / ‘학습’이라는 말의 세 가지 뜻

게임의 규칙을 배우기 ≠ 자기 자신을 재훈련하기

관찰된 행동

문제 안에서 적응

관찰과 실패↓가설 · 계획 수정

현재 문제에 대한 이해를 문맥에 쌓습니다.

훈련의 일반 개념

모델 재학습

데이터 · 보상↓신경망 가중치 변경

훈련을 통해 모델의 매개변수를 바꿉니다.

Astra 적용 여부 미확인

재귀적 자기개선

AI가 개선 방법 개발↓개선된 AI가 다시 개선 ↻

ARC 점수만으로 이 과정을 입증할 수 없습니다.

위 세 가지는 개념 구분입니다. 평가 중 가중치 변경 여부에 대한 별도 실험 결과를 뜻하지 않습니다.

알려진 범위와 남아 있는 질문

OpenAI는 사전학습·강화학습·정렬 연구의 발전을 결합했다고 설명합니다. 구체적인 훈련 방법별 기여율이나 재귀적 자기개선으로 모델을 만들었다는 근거는 확인되지 않았습니다.

ARC Prize 역시 이 점수가 AGI의 증명은 아니며, 재귀적 자기개선과 열린 문제 해결은 향후 평가할 질문으로 남겨 둡니다.

출처 · 문서 범위

2026-09-29 확인 자료를 바탕으로 작성한 참고 문서입니다. PPI 런타임 변경이나 자체 모델 실험을 보고하는 문서가 아닙니다. 도식의 게임은 설명용 가상 예시입니다.