NeoHorse-1은 라우팅 하네스를 ‘서빙 최적화’에서 다음 학습 분포를 만드...
NeoHorse-1은 에이전트 실행 중 남는 라우팅·도구·결과 기록을 커리큘럼과 온폴리시 증류, 다음 데이터 배분에 연결해 4B·9B 오픈 가중치 모델을 post-training한 초기 RSI 프로토타입이다.
Tag
NeoHorse-1은 에이전트 실행 중 남는 라우팅·도구·결과 기록을 커리큘럼과 온폴리시 증류, 다음 데이터 배분에 연결해 4B·9B 오픈 가중치 모델을 post-training한 초기 RSI 프로토타입이다.