Tag: qwen
All the articles with the tag "qwen".
-
176B를 128GB 한 대에 — Qwen3.8-Flash-Next를 GB10에 올리고 커널까지 파고든 기록
공식 양자화는 전부 메모리를 넘겼다. 미머지 PR로 빌드해 87GiB짜리 4bit를 올렸더니 이번엔 26만 토큰에서 CUDA가 죽었다. grid.y 한계 65,535까지 따라가 원인을 찾고, 모델 없이 두 줄로 재현하고, 고쳐서 검증했다.
-
같은 모델, 4개 하드웨어 — Qwen3.8-27B 추론 속도 실측
RTX 3090, Apple M5 Max, DGX Spark(GB10), Ryzen AI Max 395를 같은 GGUF 파일로 비교했다. 체크섬까지 맞춘 통제 실험에서 CUDA는 Metal의 3.9배, Vulkan의 4.5배였고 벤치마크 코드를 세 번 고쳐야 했다.
-
Qwen3.5 로컬 추론 벤치마크 결과표: 4대 하드웨어 × 5개 엔진
Updated:M5 Max, RTX 3090×2, DGX Spark GB10, Ryzen AI MAX 395에서 Qwen3.5 4개 모델(9B~122B)의 생성 속도, 프리필 속도를 llama.cpp, MLX, Ollama, vLLM, Lemonade로 측정한 결과 비교표.