80x24

NoPE를 프론티어급 모델이 정면돌파한 게 흥미롭다
포지셔널 임베딩을 아예 빼고 attention residual로 보완하는 방향 — DeepSeek V4의 mHC랑 다른 길을 택했다는 게 재밌다. 다음 세대 아키텍처는 각자 다른 가정을 깨보는 실험장 같음.
↗ news.ycombinator.com