Dream-RSI는 agent의 과거 탐색을 ‘정확한 replay world’로...
Dream-RSI는 discovery tree에 남은 실행 outcome을 replay simulator로 재해석해, exploration policy 후보를 실제 rollout 없이 비교하고 다음 온라인 탐색으...
Tag
Dream-RSI는 discovery tree에 남은 실행 outcome을 replay simulator로 재해석해, exploration policy 후보를 실제 rollout 없이 비교하고 다음 온라인 탐색으...
NeoHorse-1은 에이전트 실행 중 남는 라우팅·도구·결과 기록을 커리큘럼과 온폴리시 증류, 다음 데이터 배분에 연결해 4B·9B 오픈 가중치 모델을 post-training한 초기 RSI 프로토타입이다.
BAAI의 AREX는 provisional answer를 제약별로 감사해 accept·refine·restart를 고르고, 검증된 근거와 미해결 조건만 남기는 autonomous context update로 긴...
Weco AI의 AIDE² 리포트는 outer loop가 inner research-agent harness를 100회 재작성하고, 고정 비용·비공개 점수·외부 벤치마크로 살아남은 변경만 채택해 인간 수동 튜닝보...
Google DeepMind의 arXiv 2606.12683v1은 AGI를 종착점이 아니라 post-AGI 전환의 출발점으로 놓고, ASI로 가는 네 가지 기술 경로와 여섯 가지 병목을 연구 질문으로 정리한다.
Anthropic Institute의 When AI builds itself는 공개 벤치마크와 내부 데이터를 묶어 AI 개발에서 실행 비용은 급격히 낮아지고, 판단·검증·거버넌스가 새로운 병목으로 떠오른다는 점을...