Go to file

16337 4ac406572e fix: 修复模型加载方式，改用 FP16+CPU offload

RTX 3050 8GB 无法完整加载 Qwen3.5-9B，即使量化也不行：
- bitsandbytes 4-bit 不支持 CPU offload
- bitsandbytes 8-bit 与 accelerate 存在版本兼容问题
- FP16 + CPU offload 可以加载但推理质量极差（输出乱码）
- 推理速度仅 0.4 tokens/s

结论：RTX 3050 8GB 不适合运行 Qwen3.5-9B

Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

2026-03-16 13:05:20 +08:00

docs/plans

init: 项目初始化，添加 .gitignore 和 README

2026-03-16 11:27:17 +08:00

vsp/qwen3.5-9b

fix: 修复模型加载方式，改用 FP16+CPU offload

2026-03-16 13:05:20 +08:00

.gitignore

fix: 修复模型加载方式，改用 FP16+CPU offload

2026-03-16 13:05:20 +08:00

README.md

init: 项目初始化，添加 .gitignore 和 README