GLM-5.2의 600 tok/s는 커널 하나가 아니라 MTP acceptanc...
Sionic은 B300에서 753B MoE GLM-5.2의 batch-1 생성을 600~1000 tok/s로 끌어올렸다고 보고한다. 핵심은 SASS·TMEM 기반 커널, live FP8 quantization,...
Tag
Sionic은 B300에서 753B MoE GLM-5.2의 batch-1 생성을 600~1000 tok/s로 끌어올렸다고 보고한다. 핵심은 SASS·TMEM 기반 커널, live FP8 quantization,...
LMSYS의 Waterfill·LPLB 글은 SGLang/DeepEP MoE inference에서 shared expert와 redundant expert replica를 runtime에 재배치해 EP rank...
dFactory는 확산 언어 모델의 미세 조정을 위해 block diffusion, MoE 가중치 병합, 분산 학습, 병렬 디코딩 경로를 하나의 실행 가능한 프레임워크로 묶는다.