1
This commit is contained in:
@@ -178,6 +178,21 @@ npm run dev # Vite 开发服务器(5173),API 代理见 vite.config
|
||||
- **对话模型**(`/v1/chat/completions`,支持 SSE 流式):用于问答与知识图谱实体抽取
|
||||
- **向量模型**(`/v1/embeddings`):用于分块向量化与语义检索;维度须与 `config.yml` 中 `vector.dim` 一致(默认 1024)
|
||||
|
||||
示例(本地 oMLX,Apple Silicon 推荐):
|
||||
|
||||
```bash
|
||||
# 模型文件放 models/mlx/omlx/(chat: Qwen3.5-9B-MLX-4bit;embedding: bge-m3),
|
||||
# 依赖装在项目根 .venv/(mlx + omlx + fastapi + uvicorn)
|
||||
./scripts/start_models.sh # 启动单实例 oMLX :18080,同时提供 chat + embedding
|
||||
./scripts/stop_models.sh # 停止
|
||||
|
||||
# 设置页配置:
|
||||
# 对话模型:endpoint http://127.0.0.1:18080/v1,模型名 Qwen3.5-9B-MLX-4bit
|
||||
# 向量模型:endpoint http://127.0.0.1:18080/v1,模型名 bge-m3,维度 1024
|
||||
```
|
||||
|
||||
> 16GB 内存机器需 `sudo sysctl iogpu.wired_limit_mb=14336` 提高 Metal 上限(oMLX 内存 guard ceiling 14GB);Qwen3.5 思考链默认开启,应用侧已在 agent / 主回答 / 重排调用中通过 `chat_template_kwargs: {"enable_thinking": false}` 关闭。
|
||||
|
||||
示例(Ollama):
|
||||
|
||||
```bash
|
||||
|
||||
Reference in New Issue
Block a user