Tag: llama-cpp
All the articles with the tag "llama-cpp".
-
176B를 128GB 한 대에 — Qwen3.8-Flash-Next를 GB10에 올리고 커널까지 파고든 기록
공식 양자화는 전부 메모리를 넘겼다. 미머지 PR로 빌드해 87GiB짜리 4bit를 올렸더니 이번엔 26만 토큰에서 CUDA가 죽었다. grid.y 한계 65,535까지 따라가 원인을 찾고, 모델 없이 두 줄로 재현하고, 고쳐서 검증했다.
-
같은 모델, 4개 하드웨어 — Qwen3.8-27B 추론 속도 실측
RTX 3090, Apple M5 Max, DGX Spark(GB10), Ryzen AI Max 395를 같은 GGUF 파일로 비교했다. 체크섬까지 맞춘 통제 실험에서 CUDA는 Metal의 3.9배, Vulkan의 4.5배였고 벤치마크 코드를 세 번 고쳐야 했다.