内容标签
ModelScope
使用 llama.cpp 运行 Qwen3.8-27B
记录用 ModelScope 下载 Qwen3.8-27B 的 UD-Q4_K_M 权重,并在 RTX 4090 上通过 llama.cpp 启动纯文本服务。整理当前启动日志、初步生成速度、KV Cache 复用情况,以及尚未完成的 Agent 工具调用与稳定性测试。
使用 ModelScope 管理本地模型缓存
使用 uv tool 安装 ModelScope,配置 MODELSCOPE_CACHE,扫描、校验和清理本地模型缓存,并按需下载 Qwen GGUF 权重与视觉投影文件。说明新版目录、旧缓存重复、容量统计不一致及完整重建缓存的安全处理方法。