This commit is contained in:
2026-08-12 12:17:36 +08:00
parent b8662138a9
commit 15830ff0df
10 changed files with 90 additions and 17 deletions
+15
View File
@@ -178,6 +178,21 @@ npm run dev # Vite 开发服务器(5173),API 代理见 vite.config
- **对话模型**`/v1/chat/completions`,支持 SSE 流式):用于问答与知识图谱实体抽取
- **向量模型**`/v1/embeddings`):用于分块向量化与语义检索;维度须与 `config.yml``vector.dim` 一致(默认 1024
示例(本地 oMLXApple Silicon 推荐):
```bash
# 模型文件放 models/mlx/omlx/chat: Qwen3.5-9B-MLX-4bitembedding: bge-m3),
# 依赖装在项目根 .venv/mlx + omlx + fastapi + uvicorn
./scripts/start_models.sh # 启动单实例 oMLX :18080,同时提供 chat + embedding
./scripts/stop_models.sh # 停止
# 设置页配置:
# 对话模型:endpoint http://127.0.0.1:18080/v1,模型名 Qwen3.5-9B-MLX-4bit
# 向量模型:endpoint http://127.0.0.1:18080/v1,模型名 bge-m3,维度 1024
```
> 16GB 内存机器需 `sudo sysctl iogpu.wired_limit_mb=14336` 提高 Metal 上限(oMLX 内存 guard ceiling 14GB);Qwen3.5 思考链默认开启,应用侧已在 agent / 主回答 / 重排调用中通过 `chat_template_kwargs: {"enable_thinking": false}` 关闭。
示例(Ollama):
```bash