GLM-5.2의 600 tok/s는 커널 하나가 아니라 MTP acceptanc...
Sionic은 B300에서 753B MoE GLM-5.2의 batch-1 생성을 600~1000 tok/s로 끌어올렸다고 보고한다. 핵심은 SASS·TMEM 기반 커널, live FP8 quantization,...
Tag
Sionic은 B300에서 753B MoE GLM-5.2의 batch-1 생성을 600~1000 tok/s로 끌어올렸다고 보고한다. 핵심은 SASS·TMEM 기반 커널, live FP8 quantization,...
NVIDIA의 JAX/MaxText NVFP4 글은 Blackwell GB200·GB300에서 MLP GEMM을 4비트 NVFP4로 낮추되 RHT, 2D weight scaling, stochastic round...
ThriftAttention은 Blackwell FP4 어텐션의 장기 컨텍스트 품질 저하를 전체 고정밀 계산이 아니라 중요한 query-key block만 FP16으로 승격하는 선택적 혼합정밀 방식으로 줄이려는...