内容标签

llama.cpp

返回全部文章
AI Playground
从 ModelScope 下载 Qwen3.8-27B 的 UD-Q4_K_M 权重和 mmproj-F16 投影文件,在 RTX 4090 24GB 上启动 llama-server,给出图片输入的验证方法,并记录文本生成速度、KV Cache 复用与 unused tensor 警告。
AI Playground
使用 uv tool 安装 ModelScope,配置 MODELSCOPE_CACHE,扫描、校验和清理本地模型缓存,并按需下载 Qwen GGUF 权重与视觉投影文件。说明新版目录、旧缓存重复、容量统计不一致及完整重建缓存的安全处理方法。
AI Playground
在 Debian 和 RTX 4090 上编译 llama.cpp,使用 ModelScope 下载 Qwen3.6-27B,并接入 Claude Code 与 Codex。包含新版缓存路径、服务参数、接口与真实工具调用验证,以及已经确认的兼容边界与排错方法。
AI Playground
记录 Codex CLI 通过自定义 model provider 和独立 profile 连接本地 llama-server 的配置与验证,覆盖 Responses API、环境变量认证、沙箱和审批策略,并保留模型目录错误及 namespace、web_search 工具警告的实际排查过程。
AI Playground
记录 Claude Code 通过 Anthropic 兼容接口连接本地 llama-server 的配置,包括模型别名、认证变量、超时、状态栏和自动压缩窗口。文章用普通回复与 Bash 工具调用分别验证模型生成和 Agent 执行能力,并说明客户端窗口与服务端上下文长度的差异。