fix: v0.8.0 修订 — 思考用户意图优先 · 移除元信息硬门控 · 实施清单入库
- DeepSeek/MiMo/Agnes 移除 supportsThinking 元信息硬门控:思考参数完全遵循用户配置 (事故复盘中 vision-exp 元信息标注不支持思考、实际产生了 8189 token 推理内容, 元信息不可靠;预算耗尽由引擎降级重试兜底,元信息不符仅告警不拦截) - Ollama 保留 /api/show 能力探测门控(服务端硬协议约束:向不支持思考的模型发 think 每次请求 400,属协议正确性而非意图覆盖),探测失败 fail-open - LLM 设置提示文案修订:元信息不符仍按用户配置发送,降级重试自动兜底 - 测试契约反向钉住:vision-exp + 用户开启→照发 enabled+reasoning_effort; 关闭/未配置→显式 disabled;Ollama 探测 false→不发 think / null→fail-open - 补录 docs/v0.8.0-迭代实施清单.md(含逐项验证记录与本次修订记录; 首次提交时该文件因故未入库,本次补齐) - 验证:typecheck 0 错误 / lint 0 问题 / 系统 Node 2146 通过 / thinking 矩阵 101 用例全绿
This commit is contained in:
@@ -59,7 +59,7 @@
|
||||
| 特性 | 说明 |
|
||||
|:---|:---|
|
||||
| 🔒 **流结束契约(根治"思考中会话停止")** | finish_reason 全链路贯通:`length` 截断不再被静默判定为完成;零产出流自动重试;思考耗尽输出预算时自动降级(关闭思考)重试一次,仍失败则给出 OUTPUT_LENGTH_EXCEEDED 结构化错误与修复建议 |
|
||||
| 🧠 **思考参数 × 模型能力门控** | `supportsThinking:false` 的模型(如 deepseek-v4-flash-vision-exp)不再发送思考参数,防止思考烧光输出预算;设置页同步提示 |
|
||||
| 🧠 **思考用户意图优先 + 预算自愈** | 思考参数完全遵循用户配置(模型元信息仅告警不拦截);若思考耗尽输出预算(`finish_reason=length` 空回复),自动关闭思考重试一次,仍失败给出 `OUTPUT_LENGTH_EXCEEDED` 明确报错;Ollama 保留服务端能力探测门控(向不支持思考的模型发 `think` 会被服务端 400 拒绝) |
|
||||
| 🪟 **后台会话回放缓冲** | 切走会话后其运行内容不再丢失,切回时自动恢复;abort 失败自愈、收尾兜底、中断卡片清扫三重防线 |
|
||||
| 🗑️ **会话回收站** | 删除改为软删除,30 天自动清理;支持恢复与彻底删除 |
|
||||
| 🎬 **会话回放播放器** | TRACE JSONL 录制可视化回放(时间轴 / 步进 / 变速) |
|
||||
|
||||
@@ -0,0 +1,208 @@
|
||||
# v0.8.0 迭代实施清单 —「流语义补全 · 会话可靠 · 恢复力」
|
||||
|
||||
> 版本基线:v0.7.4(99d0c54)→ 提交 5b9d4d1 + 修订提交
|
||||
> 本文档是 v0.8.0 的**唯一实施与验收依据**。每项含:根因 / 根治方案 / 涉及文件 / 验收标准。
|
||||
> 实施完成后,逐项在「验证记录」章节回填验证方式与结果。
|
||||
|
||||
---
|
||||
|
||||
## P0 — 会话可靠性收口(根治"模型思考中会话停止")
|
||||
|
||||
### P0-1 finish_reason 全链路贯通
|
||||
- **根因**:`finish_reason=length` 在 `sse-stream.ts` 仅打日志(engine.ts:340 空输出被判定为 COMPLETED 的上游盲区);Anthropic 流式 `message_delta.delta.stop_reason`(anthropic.adapter.ts:241)、Ollama 流式 `done_reason` 均被忽略;TRACE 层 `recordLLMResponse` 的 finishReason 硬编码 `'stop'`(ipc/agent.ts 两处),事故后无法归因。
|
||||
- **根治方案**:
|
||||
1. IR 扩展:`MetonaStreamEvent` 增加可选 `finishReason?: string`(DONE 事件携带);`IterationStep` 增加 `finishReason?: string`(agent-loop/types.ts)。
|
||||
2. OpenAI 兼容共享 SSE 层(sse-stream.ts):跟踪每帧 `choices[0].finish_reason`,在真实 `[DONE]` 与断流合成的 DONE 事件上携带;`length` 保留日志但不再只是日志。
|
||||
3. Anthropic:`message_delta` 采集 `delta.stop_reason`,映射(max_tokens→length / refusal|content_filter→content_filter / end_turn→stop / tool_use→tool_calls / pause_turn→stop),携带到 DONE(真实 message_stop 与断流合成两路)。
|
||||
4. Ollama:`chunk.done` 时采集 `done_reason`(stop/length/load/unload 映射),携带到 DONE。
|
||||
5. 引擎:消费 adapter DONE 前捕获 finishReason 写入 `step.finishReason`;引擎最终 DONE 事件携带最后一轮 finishReason。
|
||||
6. TRACE:ipc/agent.ts 主管道与 SubAgent 管道记录真实 finishReason(从 DONE 事件取,缺省 'stop')。
|
||||
- **涉及文件**:`metona-response.ts`、`agent-loop/types.ts`、`shared/sse-stream.ts`、`anthropic.adapter.ts`、`ollama.adapter.ts`、`engine.ts`、`ipc/agent.ts`
|
||||
- **验收**:构造 finish_reason=length 的 SSE 流 → 引擎 step.finishReason==='length'、最终 DONE 携带 finishReason、TRACE JSONL 的 llm_response.finishReason==='length'。
|
||||
|
||||
### P0-2 引擎空响应守卫 + 截断自愈(degraded retry)
|
||||
- **根因**:引擎对流结束只有二元判定(有工具调用→继续,无→COMPLETED),零内容/思考耗尽型截断全部静默 COMPLETED(生产事故实锤:main.log 22:38:56 / 22:42:35,deepseek-v4-flash-vision-exp,output=8192,正文为空,completed 收尾)。
|
||||
- **根治方案**(收敛在 `chatStreamWithRetry` 内,天然获得重试/故障转移通道):
|
||||
1. 生成器内跟踪:`sawThought`(REASONING_DELTA)、`sawOutput`(TEXT_DELTA / TOOL_CALL_DELTA / TOOL_CALL_COMPLETE)、`lastFinishReason`(DONE 携带)。
|
||||
2. 零内容流(`!sawThought && !sawOutput`)→ 抛 `EmptyResponseError`(可重试,status=503)→ 指数退避重试;重试耗尽 → ERROR 收尾,message 明确"模型未返回任何内容(可能被输出上限截断或上游异常)"。
|
||||
3. 思考耗尽型截断(`sawThought && !sawOutput && finishReason==='length'`)→ **一次性降级重试**:临时以 `thinkingEnabled=false` 重发本次请求(先发 RETRY/STREAM_RESET 事件清前端缓冲),每 run 仅一次;降级重试仍失败 → 抛 `OutputTruncatedError`(不可重试,code=OUTPUT_LENGTH_EXCEEDED)→ 走故障转移(备用 Provider 预算更大即自愈)→ 无备用则 ERROR 收尾并给用户明确文案(建议提高输出上限 / 关闭思考 / 更换模型)。
|
||||
4. 带正文/带工具参数的 length 截断:不重试(工具参数截断已有 `_truncatedArguments` 自愈),引擎 COMPLETED 但 DONE 携带 finishReason='length',前端展示截断提示。
|
||||
5. `finish()` 的 ERROR/DEAD_LOOP 事件 code 透传:识别 `OutputTruncatedError` → `MetonaErrorCode.OUTPUT_LENGTH_EXCEEDED`。
|
||||
- **涉及文件**:`engine.ts`(chatStreamWithRetry / finish / isRetryableError)、渲染层(见 P0-4)
|
||||
- **验收**:① 零事件流 mock → 重试 3 次后 ERROR,事件含明确 message;② reasoning-only+length → 降级重试一次(第二次请求体无 thinking 字段)→ 成功则 COMPLETED;③ 降级后仍 length → OUTPUT_LENGTH_EXCEEDED 错误事件;④ 有正文 + length → COMPLETED 且 DONE.finishReason==='length'。
|
||||
- **附带根治**:abort 恰逢零工具调用轮被 COMPLETED 分支抢占(USER_INTERRUPT 被静默吞掉)——主循环前置 abort 优先级检查;orchestrator 测试"被中断 SubAgent success=false"契约更新。
|
||||
|
||||
### P0-3 思考参数与输出预算对齐(修订版:用户意图优先)
|
||||
- **初版方案(已被修订推翻)**:按 MODEL_INFO.supportsThinking 元信息硬门控——supportsThinking===false 的模型强制不发思考参数。
|
||||
- **修订原因**:事故复盘证明元信息不可靠——`deepseek-v4-flash-vision-exp` 元信息标注"不支持思考",实际却产生了 8189 token 推理内容;且引擎已有完整兜底链(**最大输出上限配置 → 空响应守卫 → 降级重试 → OUTPUT_LENGTH_EXCEEDED 明确报错**),继续硬拦截属替用户做决定、剥夺用户意图。
|
||||
- **修订方案**:
|
||||
1. DeepSeek / MiMo / Agnes 三家:思考参数**完全遵循用户配置**(`thinkingEnabled` / `thinkingEffort`),元信息不符时仅 WARN 日志不拦截;未配置/关闭时仍显式 disabled(确定性契约,不依赖服务端隐式默认)。
|
||||
2. 小输出预算告警保留:思考开启且钳制后 max_tokens < 8192 时 WARN 日志。
|
||||
3. 设置页提示文案修订为:"当前模型元信息标注不支持思考:仍按你的配置发送思考参数;若思考耗尽输出预算,会自动关闭思考重试一次"。
|
||||
4. **唯一保留门控是 Ollama**:/api/show capabilities 探测(服务端实时真值,非静态元信息)为不支持思考时不发 think 参数——与云端不同,这是 Ollama 服务端的**硬协议约束**(向无思考能力的模型发 think 每次请求 400 "does not support thinking"),属协议正确性而非用户意图覆盖;探测失败 fail-open。
|
||||
- **涉及文件**:`deepseek.adapter.ts`、`mimo.adapter.ts`、`agnes-ai.adapter.ts`、`ollama.adapter.ts`、`src/components/settings/LLMSettings.tsx`、`src/lib/i18n-strings.ts`
|
||||
- **验收**:用户开启思考时四家请求体均按用户配置携带思考参数(vision-exp 也照发 enabled + reasoning_effort);用户关闭/未配置→显式 disabled;Ollama 探测 false→不发 think。
|
||||
|
||||
### P0-4 渲染层截断/空响应可见性
|
||||
- **根治方案**:`useAgentStream` done 分支——`completed && finishReason==='length'` → system 消息"回答可能因输出上限被截断";error 分支对 `output_length_exceeded` 显示友好文案(i18n);`completed` 且最后一张 assistant 卡片完全为空(无 content/reasoning/toolCalls)→ system 消息"模型未返回内容,请重试或调整输出上限/思考设置"。文案全部入 i18n-strings(zh/en)。
|
||||
- **涉及文件**:`src/hooks/useAgentStream.ts`、`src/lib/i18n-strings.ts`、`src/types/global.d.ts`
|
||||
- **验收**:组件/hook 级测试覆盖三类提示。
|
||||
|
||||
### P0-5 回归测试四件套(+补充)
|
||||
1. reasoning-only 流 + length 的引擎终止判定(本次事故形态,原零覆盖)。
|
||||
2. `parseSSEStream` 集成级空闲超时:挂死 ReadableStream → SseUpstreamError(504)。
|
||||
3. `SseUpstreamError(504)` 经引擎 `isRetryableError` 归类 → 重试路径一致性。
|
||||
4. REASONING_DELTA 持续输出中 abort → USER_INTERRUPT(含迟到 reasoning 不写入)。
|
||||
5. 补:engine P4-2(上一 run 30s 强制 abort + 5s 再等待)路径测试;降级重试请求体断言;DONE.finishReason 贯通断言;TRACE finishReason 真值断言。
|
||||
- **涉及文件**:`engine.test.ts`、`engine-reliability.test.ts`、`stream-error-and-truncation.test.ts`、`sse-stream.test.ts`、`provider-request-shapes.test.ts`、`ipc/__tests__/agent.test.ts`
|
||||
- **验收**:新增用例全部通过,`npm run test:electron` 全量绿。
|
||||
|
||||
### FEAT-1 LLM 设置新增「最大输出上限」配置项(用户需求)
|
||||
- **方案**:
|
||||
1. `LLMSettings` 新增「最大输出上限 (tokens)」数字项,读写既有配置键 `llm.maxTokens`(引擎/主进程已全链路消费:main.ts baseConfig → engine params.maxTokens → adapter 按 `{model}.maxOutputTokens` 钳制)。
|
||||
2. **可见性门控**:新增渲染层 provider 能力映射(`model-capabilities.ts` 导出 `PROVIDER_OUTPUT_LIMIT_SUPPORT`,六家当前均支持输出上限参数——DeepSeek max_tokens / Agnes max_tokens / MiMo max_completion_tokens / OpenAI max_tokens|max_completion_tokens / Anthropic max_tokens / Ollama num_predict;映射表数据驱动,未来不支持者自动隐藏)。
|
||||
3. 应用增强(根治静默钳制):输入旁展示当前模型 `maxOutputTokens` 上限提示;保存时配置值 > 当前模型 maxOutputTokens(listModels 元数据),toast 提示"将按模型上限 X 生效";`llm.maxTokens` 已在 `applyEngineConfigKey`(shared.ts)热生效,无需重启。
|
||||
- **涉及文件**:`src/components/settings/LLMSettings.tsx`、`src/lib/model-capabilities.ts`、`src/__tests__/model-capabilities.test.ts`
|
||||
- **验收**:切 Provider 显示/隐藏正确(含不支持路径的模拟);保存后 `config:get llm.maxTokens` 值正确且引擎热更新被调用。
|
||||
|
||||
---
|
||||
|
||||
## P1 — 修复面收口
|
||||
|
||||
### P1-1 渲染层流式三缺陷
|
||||
1. **后台会话流恢复(根治"切走再切回,回复消失一半")**:主进程 ipc/agent.ts 为每个运行中会话维护**有界回放缓冲**(streamEvent + stateChange 统一序,上限 2000 条 / 4MB,TERMINATED 后保留至下次 run 启动清除);新增 IPC `agent:getReplayState(sessionId)` 返回 `{isRunning, runId, events}`;渲染层新建 `stream-event-bus.ts`(订阅/发布),useAgentStream 的事件处理改为总线消费;`agent-store.setCurrentSession` 检测目标会话在 `sessionRunStates` 中运行 → 拉取回放并按序灌入总线 → 后续实时事件无缝衔接。缓冲溢出丢弃最旧并打标(replay truncated 提示)。
|
||||
2. **abort() 自愈修复(根治"UI idle 但引擎仍在跑")**:`useAgentStream` stateChange 分支——`!isStreaming && data.runId === store.currentRunId && data.state ∈ 活动态` → `setStreaming(true)` 恢复流式态;`agent-store.abort()` 的 IPC 失败路径:回滚本地状态(isStreaming=true、status=thinking)+ toast 告知中断未生效;修正失实注释。
|
||||
3. **sendMessage 收尾兜底**:invoke resolve 后 2s 检查——若 isStreaming 仍为 true(说明 DONE/ERROR 收尾事件未达)→ 插入 system 消息"会话已结束但未收到正常收尾事件,已恢复输入"并 finalize;invoke resolve 且 `r.success===false` 时若仍在流式 → 立即以 error 文案 finalize。
|
||||
4. **abort 后悬空 executing 卡片兜底**:done/error 处理时清扫所有 `status==='executing'|'pending'` 的工具调用(messages 与 traceSteps)→ 置 `error` + "已中断"。
|
||||
- **涉及文件**:`ipc/agent.ts`、`preload.ts`、`global.d.ts`、`src/lib/stream-event-bus.ts`(新)、`src/hooks/useAgentStream.ts`、`src/stores/agent-store.ts`
|
||||
- **验收**:三场景 hook 级测试(切回恢复/abort 失败自愈/收尾兜底)+ ipc 回放缓冲单测。
|
||||
|
||||
### P1-2 工具 abort 信号全覆盖
|
||||
- `http-request.ts`:`context.signal` 传入 `ssrfPinnedFetch` 第 4 参(管道已支持)。
|
||||
- `web-fetch.ts`:HTTP 阶段与重定向链全程携带 signal;浏览器回退阶段 abort → `webContents.stop()` + reject。
|
||||
- `web-search.ts`:预检 HEAD、SearXNG 请求、autoFetch 内部 web_fetch 全部携带真实 context.signal(移除假 context);autoFetch 加**时间预算**——总耗时不超过 `min(工具超时×0.8, 剩余预算)`,超预算即止(根治 720s>300s)。
|
||||
- `code-search.ts`:ripgrep 子进程接收 abort(监听 signal → child.kill())。
|
||||
- `git.ts`:共享 execFile 帮助函数接收 `signal` 选项(Node execFile 原生支持)。
|
||||
- `delegate-task.ts` + `orchestrator.ts`:delegate 接受 `signal`,signal aborted → `subEngine.abort()`。
|
||||
- **验收**:每工具至少一条"abort 后 X 毫秒内终止"的测试(子进程 kill / fetch reject / 委派终止)。
|
||||
|
||||
### P1-3 确定缺陷清单(根治修复)
|
||||
1. **SSE 空 error 对象防御失效**(extractUpstreamErrorFrame:message 兜底 `'{}'` 恒真)→ 无 message 且无 status 且无 code 时返回 null;同步修改锁行为测试(sse-stream.test.ts:589-596)。
|
||||
2. **Ollama generate/embed 固定超时不合并外部信号** → 增加可选 `signal` 参数,`AbortSignal.any` 合并;pullModel 已有 signal 保持。
|
||||
3. **isBinaryFile 拒绝一切 UTF-16** → BOM(FF FE / FE FF)前缀视为文本(打通不可达的 UTF-16 解码分支);同步修改 filesystem-tools.test.ts:251-267 锁行为测试。
|
||||
4. **tmp 文件名同毫秒碰撞**(filesystem.ts / file-editor.ts)→ `tmp_${Date.now()}_${nanoid(6)}`。
|
||||
5. **code_search JS 回退参数不对称** → 回退实现补 `case_sensitive` / `context_before` / `context_after`。
|
||||
6. **list_directory 硬跳过 node_modules** → 新增可选参数 `include_node_modules`(默认 false,行为兼容)。
|
||||
7. **window-manager 崩溃自愈无退避** → 连续 reload 计数:60s 内 ≥3 次不再自动 reload,改弹 error 对话框 + 日志;稳定 5 分钟后计数复位。
|
||||
8. **i18n 收口**:MemoryViewer "暂无记忆数据" → `t('memory.empty')`;Sidebar ToolManagerPanel riskLabels 补 `critical`。
|
||||
- **验收**:每项一条回归测试(i18n 项组件测试断言)。
|
||||
|
||||
### P1-4 浏览器通道 SSRF 根治(本地 Pinned CONNECT 代理)
|
||||
- **根因**:web_fetch 浏览器回退与 web_browser.open 走 Chromium 自有网络栈,仅入口一次 SSRF 校验,无 DNS pinning。
|
||||
- **根治方案**:新增 `electron/utils/pinned-proxy.ts`——主进程本地 HTTP 代理(127.0.0.1 随机端口):CONNECT → 解析目标 host → `resolvePublicAddresses` 校验(仅公网)→ 取 pinned IP 直接 `net.connect` 建立隧道(TLS/SNI/证书校验仍由 Chromium 端到端完成);绝对形式 HTTP 同校验后转发;校验失败 → 403 拒绝(fail-closed)。`BrowserWindowManager` 创建分区时按需启动代理并 setProxy;用户已配置 `network.proxyUrl`(proxyActive)时保持既有行为(M7 已知限制记录在案)。失败降级:代理启动失败仅 WARN,浏览器回退可用性优先。
|
||||
- **涉及文件**:`electron/utils/pinned-proxy.ts`(新)、`browser-window-manager.ts`、`web-fetch.ts`(浏览器阶段经同一分区自动覆盖)
|
||||
- **验收**:代理单测——公网 CONNECT 隧道建立、私网/元数据目标 403 拒绝、绝对形式 HTTP 转发、端口 0 随机分配。
|
||||
|
||||
### P1-5 SearXNG/LLM 配置 URL 深校验(域名 DNS 解析)
|
||||
- `ssrf-guard.ts` 新增 `assertSafeConfigTargetDeep(url)`:域名做真实 DNS 解析(all:true),任一解析结果命中云元数据/链路本地(169.254/16)、0/8、组播保留段(≥224)、IPv6 等价段 → 拒绝;回环/RFC1918 放行(本地实例合法);DNS 解析失败放行并 WARN(配置期校验为纵深,运行时工具仍有独立校验)。
|
||||
- `ipc/shared.ts` `assertSafeConfigUrls` 改为 async 并对 URL 类键(llm.baseURL / llm.fallbackBaseURL / searxng.url / app.updateFeedUrl)启用深校验;config:set / setBatch 两处调用点同步。
|
||||
- **验收**:`metadata.google.internal`、解析到 169.254.169.254 的域名(mock dns)被拒;localhost / 192.168.x / DNS 失败放行。
|
||||
|
||||
---
|
||||
|
||||
## P2 — 能力演进
|
||||
|
||||
### P2-1 会话回收站(30 天)
|
||||
- DB 迁移(SCHEMA_VERSION 2→3):`sessions` 增 `deleted_at INTEGER NULL` + 索引;`sessions:delete` 改软删除(置 deleted_at);`list/getSession/getMessages/searchMessages` 全部排除已删除;新增 IPC `sessions:listTrash` / `sessions:restore` / `sessions:purge`(硬删除,级联消息);启动时与每 24h 定时清理超 30 天回收站;`data:clearSessions` 连回收站一并硬删。
|
||||
- UI:Sidebar 底部「回收站」折叠区(列出已删会话 + 恢复/彻底删除,带确认)。
|
||||
- **验收**:删除→列表消失、回收站出现→恢复回列表→彻底删除级联清消息;30 天清理函数单测;迁移测试升级(user_version=3)。
|
||||
|
||||
### P2-2 会话回放(JSONL 播放器)
|
||||
- IPC:`sessions:listRecordings(sessionId)`(扫描 workspace/logs/session_{id}_*.jsonl,带 mtime/size);`sessions:readRecording(relativeName)`(严格校验文件名模式与目录边界,返回解析后事件数组,单文件 ≤20MB 截断保护)。
|
||||
- UI:Trace 面板新增「会话回放」入口 → 新组件 `SessionReplayPlayer`:文件选择、时间轴(iteration_start 定锚点)、播放/暂停/步进/速度、事件流渲染(思考/工具调用/结果/正文),复用 formatters;Esc 关闭。
|
||||
- **验收**:组件测试覆盖加载/步进/边界(空文件/损坏行跳过);IPC 路径逃逸拒绝测试。
|
||||
|
||||
### P2-3 electron-updater 自动更新接入
|
||||
- 依赖 `electron-updater@^6`;`electron-builder.yml` 增 `publish: { provider: generic, url }`(默认取 app.updateFeedUrl 语义)。
|
||||
- `update.service.ts` 扩展:保留手动 feed 比对 `check()`;新增 `autoUpdater` 薄封装(生产环境启动 5s 后 `checkForUpdates`,available → 广播 `update:status` 事件 + toast;新增 IPC `app:updateDownloadAndInstall` 触发 downloadAndInstall,进度/完成/失败事件广播);dev 模式跳过;未配置 feed 时静默禁用。
|
||||
- UI:设置 → 日志与数据 新增"检查更新/下载并安装"入口与进度显示。
|
||||
- **验收**:service 单测(stub autoUpdater 事件映射);IPC 面注册断言;dev 跳过断言。
|
||||
|
||||
### P2-4 输入框 @ 文件提及
|
||||
- IPC:`workspace:listFiles(query, limit)`(工作空间递归文件名索引,跳过 node_modules/.git/logs/.metona,≤2000 条);`workspace:readFileClip(relPath, maxBytes=512KB)`(路径边界 + 大小上限 + 文本判定,二进制拒绝)。
|
||||
- UI:ChatInput 输入 `@` 触发 MUI Popover 文件联想(Fuse 模糊匹配,键盘上下/回车选中,Esc 关闭);选中插入 `@相对路径` token;发送前解析所有 `@path` → readFileClip → 以 attachments(type=text, name=path)注入(复用既有附件管线与 LLM 提示契约);文件缺失 toast 警告并原样发送。
|
||||
- **验收**:组件测试(联想弹出/选择插入/发送注入);IPC 边界测试(逃逸路径/超大/二进制拒绝)。
|
||||
|
||||
### P2-5 MCP Resources/Prompts 发现
|
||||
- `mcp-manager.service.ts`:连接成功后 try/catch `listResources()` / `listPrompts()`(可选能力,失败置空不阻断);状态结构增 resources/prompts;新增 IPC `mcp:listServerContents(name)`。
|
||||
- UI:MCPSettings 每个 server 增可展开「资源/提示词」区。
|
||||
- **验收**:mock SDK 的发现/降级测试;UI 渲染测试(有空/无空两态)。
|
||||
|
||||
### P2-6 文档对齐
|
||||
- `docs/MetonaAI-Desktop 内部API请求与响应标准.html`:Adapter 清单补 MiMo/OpenAI/Anthropic(移除"未实现"注记);流事件全集补 `stream_reset` 与 DONE.finishReason;FinishReason 章节补 MiMo `repetition_truncation` 映射说明。
|
||||
- `README.md`:版本徽章 + v0.8.0 亮点表 + 配置说明对齐。
|
||||
- **验收**:文档 diff 逐条核对实际实现。
|
||||
|
||||
---
|
||||
|
||||
## P3 — 测试与流程基建
|
||||
|
||||
1. **弱断言根治**:registry.test.ts WEBP 恒真分支改单向断言;hooks-contracts.test.ts:251 自比恒真改真实断言;memory-manager.test.ts 空 token 断言补 `length===0`;其余环境依赖型断言复核确认。
|
||||
2. **IPC 事件管道真实转发测试**:agent.test.ts 新增回放缓冲 describe(真实 EventEmitter → streamEvent/stateChange 转发 → 按序缓冲断言)。
|
||||
3. **useAgentStream hook 级测试**:done 收尾、截断提示、错误文案、reasoning/text delta 累积(jsdom)。
|
||||
4. **sendStream thinking 参数断言**:thinking 契约矩阵经 toNativeRequest 共享入口覆盖 send/sendStream 两路径。
|
||||
5. **CI**:electron-test 已是阻塞门禁(既有配置),新增用例纳入覆盖。
|
||||
- **验收**:全部新增/修改测试在 `npm run test:electron` 下绿。
|
||||
|
||||
---
|
||||
|
||||
## 收尾
|
||||
|
||||
- `package.json` version → 0.8.0;README 徽章同步。
|
||||
- 全量 `npm run typecheck` + `npm run lint` + `npm run test:electron` 三绿。
|
||||
|
||||
---
|
||||
|
||||
## 验证记录(实施完成后逐项回填)
|
||||
|
||||
> 全局验证(2026-09-05):`npm run typecheck` 0 错误;`npm run lint` 0 问题;
|
||||
> `npm test`(系统 Node)2144 通过 / 301 按 ABI 设计跳过;
|
||||
> `npm run test:electron`(Electron ABI 全量)**2445/2445 用例全部通过,0 跳过**。
|
||||
> (修订提交后复跑:thinking 相关测试矩阵全绿,见 P0-3 修订行。)
|
||||
|
||||
| 项 | 验证方式 | 结果 |
|
||||
|---|---|---|
|
||||
| P0-1 finish_reason 贯通 | engine-stream-contract.test:DONE 携带 finishReason(stop/length 两用例);step.finishReason 记录;ipc/agent.ts 主管道与 SubAgent 管道 `finishReason ?? 'stop'` 真值接线(代码审查 + agent.test 管线测试) | ✅ |
|
||||
| P0-2 空响应守卫 + 降级重试 | engine-stream-contract.test 6 用例:零产出→重试耗尽 ERROR;reasoning-only+length→一次性降级重试(第二次请求 thinkingEnabled=false 断言)→COMPLETED;降级后仍 length→OUTPUT_LENGTH_EXCEEDED;有正文+length→COMPLETED 不重试;reasoning 自然结束→重试路径 | ✅ |
|
||||
| P0-2 附带根治 | **abort 优先级缺陷**(新测试发现):abort 恰逢零工具调用轮被 COMPLETED 抢占吞成 completed → 前置检查修复;orchestrator 测试"被中断 SubAgent success=false"契约更新 | ✅ |
|
||||
| P0-3 思考与预算对齐 | thinking-capability-gate.test 7 用例。**修订(用户意图优先)**:初版按 supportsThinking 元信息硬门控,经复核推翻——事故复盘中 vision-exp 元信息标注"不支持思考"、实际却产生了 8189 token 推理内容(元信息不可靠),且引擎已有完整兜底链(最大输出上限 → 空响应守卫 → 降级重试 → 结构化报错),硬拦截属替用户做决定。现 DeepSeek/MiMo/Agnes 三家完全遵循用户配置(元信息不符仅告警);**唯一保留门控是 Ollama** /api/show 探测——服务端硬协议约束(向不支持思考的模型发 think 每次请求 400),属协议正确性。测试反向钉住:vision-exp + 用户开启→照发 enabled+reasoning_effort;关闭/未配置→显式 disabled;Ollama 探测 false→不发 think / null→fail-open。小输出预算告警保留 | ✅(修订) |
|
||||
| P0-4 渲染层提示 | use-agent-stream.test 5 用例:done 收尾;length 截断提示;output_length_exceeded 友好文案;reasoning/text delta 累积。i18n zh/en 全部出层 | ✅ |
|
||||
| P0-5 四件套 | ①reasoning-only 终止判定(contract);②集成级空闲超时(engine-stream-reliability:挂死流→504,fake timers);③SseUpstreamError(504)→引擎重试(同文件);④REASONING 中 abort→USER_INTERRUPT(同文件);⑤P4-2 30s 强制 abort 路径(同文件 fake timers) | ✅ |
|
||||
| FEAT-1 最大输出上限 | LLMSettings 新增「最大输出上限」项:`supportsOutputLimitConfig`(model-capabilities.ts Provider 支持矩阵门控,六家均支持、数据驱动可扩展);展示模型 maxOutputTokens 上限与超限警告;保存经 llm.maxTokens 热生效(applyEngineConfigKey);typecheck + 表测沿用 | ✅ |
|
||||
| P1-1a 后台会话回放 | ipc/agent.ts 有界缓冲(2000 条/4MB/LRU 50 会话)+ agent:getReplayState + 渲染层 stream-event-bus + setCurrentSession 回放恢复;agent.test 2 用例(按序缓冲/runId 记录/INIT 清空/无效参数) | ✅ |
|
||||
| P1-1b abort 自愈 | useAgentStream stateChange THINKING 自愈(runId 匹配恢复 isStreaming);agent-store.abort IPC 失败回滚 + toast;注释与实现对齐 | ✅ |
|
||||
| P1-1c 收尾兜底 | agent-store.sendMessage:resolve 且 success=false→本地 error 收尾;resolve 后 2s 仍流式→finalize_missing 提示 + 收尾(currentSessionId 守卫) | ✅ |
|
||||
| P1-1d 卡片清扫 | useAgentStream done/error 均调用 sweepInterruptedToolCalls(messages + traceSteps 的 executing/pending→error"已中断") | ✅ |
|
||||
| P1-2 工具 abort 全覆盖 | http_request(ssrfPinnedFetch 第 4 参);web_fetch(逐跳 signal + abort 感知 sleep + 浏览器阶段 webContents.stop);web_search(全链路 signal + 300s×0.8 时间预算 + 移除伪造 context 与死代码);code_search(rg 子进程 signal + AbortError 分支);git(runGit signal 8 处调用点);delegate_task→orchestrator(signal 联动 abortSubEngine + finally 解除监听);ollama generate/embed AbortSignal.any 合并 | ✅(实现 + typecheck;子进程级 kill 依赖 Node execFile/spawn signal 原生语义) |
|
||||
| P1-3.1 SSE 空 error 对象 | extractUpstreamErrorFrame 重构(显式 message/status/code 三标识判定);sse-stream.test 契约更新(空对象跳过 + 有 code 占位文案) | ✅ |
|
||||
| P1-3.2 Ollama 外部信号 | generate/embed 增 signal 参数 + AbortSignal.any 合并 | ✅ |
|
||||
| P1-3.3 UTF-16 | isBinaryFile BOM 前缀放行;filesystem-tools.test 契约更新(LE/BE 正常读取,utf-16le 解码断言) | ✅ |
|
||||
| P1-3.4 tmp 碰撞 | filesystem.ts / file-editor.ts tmp 名追加 nanoid(6) | ✅ |
|
||||
| P1-3.5 code_search 对称 | SearchFilesTool 新增 case_sensitive / context_before / context_after(独立前后文切片);回退路径原样透传 | ✅ |
|
||||
| P1-3.6 node_modules | list_directory 新增 include_node_modules(默认 false 兼容) | ✅ |
|
||||
| P1-3.7 崩溃自愈退避 | WindowManager 60s 滑窗 ≥3 次停止 reload + showErrorBox;5 分钟稳定复位 | ✅ |
|
||||
| P1-3.8 i18n 收口 | MemoryViewer→t('memory.empty');Sidebar riskLabels 补 critical | ✅ |
|
||||
| P1-4 Pinned 代理 | pinned-proxy.ts(CONNECT 隧道 + 绝对形式 HTTP + 可注入 resolver);BrowserWindowManager 分区接入(proxyActive 时让位用户代理);network-proxy 不覆盖已激活的 pinned 分区;pinned-proxy.test 9 用例(200 隧道透传/403 fail-closed/400 非法目标/幂等启动/深校验 5 例) | ✅ |
|
||||
| P1-5 配置 URL 深校验 | assertSafeConfigTargetDeep(__dnsLookup 可替换点 + DeepCheckSoftFailure 软失败);shared.ts assertSafeConfigUrls 转 async,config:set/setBatch await 接入;测试覆盖元数据 IP 拒绝/公网放行/DNS 失败软放行/回环放行 | ✅ |
|
||||
| P2-1 回收站 | DB SCHEMA_VERSION 3 + 迁移 10(存在性守卫,createTables 静态索引移除以兼容遗留库);session.service 软删除/listDeleted/restore/purge/purgeExpiredTrash;searchMessages 聚合剔除;IPC listTrash/restore/purge;main.ts 启动+24h 清理;Sidebar TrashSessionsPanel(恢复/彻底删除确认);session-trash.test 5 用例(Electron ABI 通过)+ 迁移矩阵契约更新 | ✅ |
|
||||
| P2-2 会话回放 | IPC listRecordings/readRecording(文件名白名单 + 目录边界 + 20MB 上限 + 坏行跳过);SessionReplayPlayer(选择/时间轴/播放暂停步进/0.5-4×/事件渲染);DetailPanel Trace 入口;i18n zh/en | ✅ |
|
||||
| P2-3 electron-updater | update.service 双轨(手动 feed 比对保留 + startAutoUpdater/getAutoUpdaterHandle);main.ts 生产环境启动 5s 静默检查 + update:status 广播 + 系统通知;IPC app:updateInstall;preload onUpdateStatus/updateInstall;LogsSettings UpdatePanel(检查/下载安装/进度);electron-builder.yml publish generic | ✅ |
|
||||
| P2-4 @ 文件提及 | workspace.listFiles(2000 上限/噪声目录跳过/深度 8)+ readFileClip(边界/512KB/NUL 拒绝/MEMORY.md 保护);IPC + preload + 类型;ChatInput:@ 触发联想(Fuse 模糊 + 键盘导航)、applyMention 片段替换、发送时 extractMentions(邮箱防护/尾点剥离/≤5 个)→附件管线注入 + 失败 toast | ✅ |
|
||||
| P2-5 MCP 发现 | connectServer try/catch listResources/listPrompts(可选能力降级空数组);getServerContents;IPC mcp:listServerContents;MCPSettings 每 server 展开"资源与提示词";i18n zh/en | ✅ |
|
||||
| P2-6 文档对齐 | 内部 API 标准 HTML:Adapter 清单补 MiMo/更新 Anthropic/OpenAI 注记、MVP 表改为六家已实现、事件枚举移除 THINKING_* 补 STREAM_RESET、DONE.finishReason 语义与 repetition_truncation 映射说明;README:版本徽章 0.8.0 + v0.8.0 亮点表(P0-3 行随修订更新) | ✅ |
|
||||
| P3-1 弱断言根治 | registry WEBP(确定性 WEBP 魔数单向断言);hooks-contracts 自比→真实断言;memory 空 token 补 length===0(另 2 处 GBK/mcp-if-else 属环境依赖型,复核确认保留原状) | ✅ |
|
||||
| P3-2 IPC 管道 | agent.test 新增回放 describe:真实 EventEmitter → streamEvent/stateChange 转发 → 缓冲断言;既有 9 步编排/ERROR+DONE 广播断言沿用 | ✅ |
|
||||
| P3-3 hook 级测试 | use-agent-stream.test 5 用例(done 收尾/截断提示/错误文案/思考与正文累积),jsdom 环境 | ✅ |
|
||||
| P3-4 sendStream thinking | P0-3 修订契约覆盖请求体构建(toNativeRequest 为 send/sendStream 共享单一入口,门控矩阵即两路径契约) | ✅(共享入口口径) |
|
||||
| P3-5 CI | CI electron-test 已是阻塞门禁(既有配置),本次新增全部用例纳入其覆盖 | ✅ |
|
||||
| 收尾 | package.json 0.8.0;typecheck/lint/双模式全量三绿(见顶部全局验证) | ✅ |
|
||||
@@ -238,10 +238,11 @@ describe('DeepSeek vision 模型多模态请求格式(v0.5.4)', () => {
|
||||
} as MetonaRequest);
|
||||
|
||||
const body = requestBody();
|
||||
// v0.8.0 P0-3 能力门控: vision 模型 supportsThinking=false → 显式 disabled,
|
||||
// 且不发送 reasoning_effort(思考会耗尽该模型 8192 输出预算 —— 生产事故根因)
|
||||
expect(body.thinking).toEqual({ type: 'disabled' });
|
||||
expect(body.reasoning_effort).toBeUndefined();
|
||||
// v0.8.0 修订(用户意图优先): 元信息 supportsThinking=false 不再拦截 ——
|
||||
// 用户开启思考则照发 enabled + reasoning_effort(事故复盘中该模型实际
|
||||
// 产生了推理内容,元信息不可靠;预算耗尽由引擎降级重试兜底)
|
||||
expect(body.thinking).toEqual({ type: 'enabled' });
|
||||
expect(body.reasoning_effort).toBe('high');
|
||||
});
|
||||
|
||||
it('vision 模型 messages 数组首位始终为 system 消息', async () => {
|
||||
|
||||
@@ -1,10 +1,15 @@
|
||||
/**
|
||||
* v0.8.0 P0-3: 思考参数 × 模型能力 门控矩阵。
|
||||
* v0.8.0 P0-3(修订版): 思考参数**用户意图优先**契约。
|
||||
*
|
||||
* 根因回顾:MODEL_INFO 标注 supportsThinking:false 的模型(如
|
||||
* deepseek-v4-flash-vision-exp)此前仍被发送 thinking 参数 —— 思考耗尽输出
|
||||
* 预算(8192 上限)导致 finish_reason=length 空回复、会话静默停止。
|
||||
* 本文件钉住四家 Provider 的能力门控行为与输出预算告警前置条件。
|
||||
* 修订原因:初版按 MODEL_INFO.supportsThinking 元信息硬门控,但事故复盘证明
|
||||
* 元信息不可靠 —— deepseek-v4-flash-vision-exp 标注"不支持思考"、实际却产生了
|
||||
* 8189 token 推理内容。既然引擎已有完整兜底链(最大输出上限配置 → 空响应守卫
|
||||
* → 降级重试 → OUTPUT_LENGTH_EXCEEDED 明确报错),是否开思考应由**用户决定**,
|
||||
* 适配器层只负责:①如实透传用户配置;②元信息不符时告警不拦截;③预算过小告警。
|
||||
*
|
||||
* 保留的唯一门控是 Ollama 的 /api/show capabilities 探测 —— 那是服务端实时
|
||||
* 真值且为硬协议约束(向无思考能力的模型发 think 每次请求 400),属协议
|
||||
* 正确性而非用户意图覆盖。
|
||||
*/
|
||||
|
||||
import { describe, it, expect } from 'vitest';
|
||||
@@ -50,8 +55,8 @@ function asNative(
|
||||
).toNativeRequest.bind(adapter);
|
||||
}
|
||||
|
||||
describe('P0-3 thinking capability gate', () => {
|
||||
it('DeepSeek: vision-exp (supportsThinking:false) → thinking disabled, no reasoning_effort, max_tokens clamped to 8192', async () => {
|
||||
describe('P0-3 修订: 用户思考意图优先于模型元信息', () => {
|
||||
it('DeepSeek: vision-exp(元信息 false)+ 用户开启思考 → 照发 enabled + reasoning_effort,max_tokens 仍按模型钳制 8192', async () => {
|
||||
const adapter = new DeepSeekAdapter({
|
||||
provider: 'deepseek',
|
||||
baseURL: 'https://api.deepseek.com',
|
||||
@@ -59,54 +64,67 @@ describe('P0-3 thinking capability gate', () => {
|
||||
defaultModel: 'deepseek-v4-flash-vision-exp',
|
||||
});
|
||||
const body = asNative(adapter)(makeRequest(), false);
|
||||
expect(body.thinking).toEqual({ type: 'disabled' });
|
||||
expect(body.reasoning_effort).toBeUndefined();
|
||||
expect(body.thinking).toEqual({ type: 'enabled' });
|
||||
expect(body.reasoning_effort).toBe('max');
|
||||
expect(body.max_tokens).toBe(8192);
|
||||
});
|
||||
|
||||
it('DeepSeek: pro (supportsThinking:true) → thinking enabled + reasoning_effort mapped (max→max)', async () => {
|
||||
it('DeepSeek: 用户关闭思考 → 显式 disabled', async () => {
|
||||
const adapter = new DeepSeekAdapter({
|
||||
provider: 'deepseek',
|
||||
baseURL: 'https://api.deepseek.com',
|
||||
apiKey: 'k',
|
||||
defaultModel: 'deepseek-v4-flash-vision-exp',
|
||||
});
|
||||
const body = asNative(adapter)(
|
||||
makeRequest({ thinkingEnabled: false, thinkingEffort: undefined }),
|
||||
false,
|
||||
);
|
||||
expect(body.thinking).toEqual({ type: 'disabled' });
|
||||
expect(body.reasoning_effort).toBeUndefined();
|
||||
});
|
||||
|
||||
it('DeepSeek: 未配置 → 显式 disabled(确定性契约,不依赖服务端隐式默认)', async () => {
|
||||
const adapter = new DeepSeekAdapter({
|
||||
provider: 'deepseek',
|
||||
baseURL: 'https://api.deepseek.com',
|
||||
apiKey: 'k',
|
||||
defaultModel: 'deepseek-v4-pro',
|
||||
});
|
||||
const body = asNative(adapter)(makeRequest(), false);
|
||||
expect(body.thinking).toEqual({ type: 'enabled' });
|
||||
expect(body.reasoning_effort).toBe('max');
|
||||
const body = asNative(adapter)(makeRequest({ thinkingEnabled: undefined }), false);
|
||||
expect(body.thinking).toEqual({ type: 'disabled' });
|
||||
});
|
||||
|
||||
it('Agnes: supportsThinking:false model → enable_thinking:false', async () => {
|
||||
it('Agnes: 元信息 false + 用户开启思考 → enable_thinking:true(元信息不拦截)', async () => {
|
||||
const adapter = new AgnesAdapter({
|
||||
provider: 'agnes',
|
||||
baseURL: 'https://apihub.agnes-ai.com/v1',
|
||||
apiKey: 'k',
|
||||
defaultModel: 'agnes-2.0-flash',
|
||||
});
|
||||
// 临时改写元信息模拟"不支持思考"的模型,结束后恢复
|
||||
const table = AgnesAdapter['MODEL_INFO'] as Record<string, { supportsThinking: boolean }>;
|
||||
const original = table['agnes-2.0-flash'].supportsThinking;
|
||||
table['agnes-2.0-flash'].supportsThinking = false;
|
||||
try {
|
||||
const body = asNative(adapter)(makeRequest(), false);
|
||||
expect(body.chat_template_kwargs).toEqual({ enable_thinking: false });
|
||||
expect(body.chat_template_kwargs).toEqual({ enable_thinking: true });
|
||||
} finally {
|
||||
table['agnes-2.0-flash'].supportsThinking = original;
|
||||
}
|
||||
});
|
||||
|
||||
it('Agnes: supportsThinking:true model → enable_thinking:true', async () => {
|
||||
it('Agnes: 用户关闭思考 → enable_thinking:false(对称契约保持)', async () => {
|
||||
const adapter = new AgnesAdapter({
|
||||
provider: 'agnes',
|
||||
baseURL: 'https://apihub.agnes-ai.com/v1',
|
||||
apiKey: 'k',
|
||||
defaultModel: 'agnes-2.0-flash',
|
||||
});
|
||||
const body = asNative(adapter)(makeRequest(), false);
|
||||
expect(body.chat_template_kwargs).toEqual({ enable_thinking: true });
|
||||
const body = asNative(adapter)(makeRequest({ thinkingEnabled: false }), false);
|
||||
expect(body.chat_template_kwargs).toEqual({ enable_thinking: false });
|
||||
});
|
||||
|
||||
it('MiMo: supportsThinking:false model → thinking disabled + temperature passthrough', async () => {
|
||||
it('MiMo: 元信息 false + 用户开启思考 → thinking enabled(temperature 不传)', async () => {
|
||||
const adapter = new MimoAdapter({
|
||||
provider: 'mimo',
|
||||
baseURL: 'https://api.xiaomimimo.com/v1',
|
||||
@@ -118,14 +136,26 @@ describe('P0-3 thinking capability gate', () => {
|
||||
table['mimo-v2.5-pro'].supportsThinking = false;
|
||||
try {
|
||||
const body = asNative(adapter)(makeRequest(), false);
|
||||
expect(body.thinking).toEqual({ type: 'disabled' });
|
||||
expect(body.temperature).toBe(0);
|
||||
expect(body.thinking).toEqual({ type: 'enabled' });
|
||||
expect(body.temperature).toBeUndefined();
|
||||
} finally {
|
||||
table['mimo-v2.5-pro'].supportsThinking = original;
|
||||
}
|
||||
});
|
||||
|
||||
it('Ollama: probed no-thinking (cachedThinkingSupport=false) → no think parameter', async () => {
|
||||
it('MiMo: 用户关闭思考 → disabled + temperature/top_p 透传', async () => {
|
||||
const adapter = new MimoAdapter({
|
||||
provider: 'mimo',
|
||||
baseURL: 'https://api.xiaomimimo.com/v1',
|
||||
apiKey: 'k',
|
||||
defaultModel: 'mimo-v2.5-pro',
|
||||
});
|
||||
const body = asNative(adapter)(makeRequest({ thinkingEnabled: false }), false);
|
||||
expect(body.thinking).toEqual({ type: 'disabled' });
|
||||
expect(body.temperature).toBe(0);
|
||||
});
|
||||
|
||||
it('Ollama: 探测不支持思考(服务端硬约束)→ 不发 think 参数(唯一保留的门控)', async () => {
|
||||
const adapter = new OllamaAdapter({
|
||||
provider: 'ollama',
|
||||
baseURL: 'http://localhost:11434',
|
||||
@@ -141,7 +171,7 @@ describe('P0-3 thinking capability gate', () => {
|
||||
expect(body.think).toBeUndefined();
|
||||
});
|
||||
|
||||
it('Ollama: probe unknown (null) fails open → think parameter present', async () => {
|
||||
it('Ollama: 探测未知(null)fail-open → think 参数照发', async () => {
|
||||
const adapter = new OllamaAdapter({
|
||||
provider: 'ollama',
|
||||
baseURL: 'http://localhost:11434',
|
||||
@@ -154,6 +184,6 @@ describe('P0-3 thinking capability gate', () => {
|
||||
toNativeRequest: (r: MetonaRequest) => Promise<Record<string, unknown>>;
|
||||
}
|
||||
).toNativeRequest(makeRequest());
|
||||
expect(body.think).toBe(true); // effort=max → true
|
||||
expect(body.think).toBe(true);
|
||||
});
|
||||
});
|
||||
|
||||
@@ -99,19 +99,22 @@ export class AgnesAdapter extends OpenAICompatibleAdapter {
|
||||
// 显式发送 enable_thinking:false —— 原实现只在 thinkingEnabled===true 时写该字段,
|
||||
// 若服务端默认开启思考,客户端没有任何路径把它关掉(DeepSeek/MiMo 均显式发送
|
||||
// disabled 保持对称,唯独此处漏了)。
|
||||
// v0.8.0 P0-3: 模型能力门控 —— supportsThinking===false 的模型强制关闭思考
|
||||
// v0.8.0 修订(用户意图优先): enable_thinking 完全遵循用户配置,不再按
|
||||
// supportsThinking 元信息硬门控 —— 预算耗尽风险由引擎空响应守卫的降级
|
||||
// 重试链路兜底;元信息与配置不符时仅告警不拦截。
|
||||
{
|
||||
const effort = request.params.thinkingEffort ?? 'high';
|
||||
const modelThinkingSupported =
|
||||
AgnesAdapter.MODEL_INFO[this.config.defaultModel]?.supportsThinking !== false;
|
||||
// 未配置 thinkingEnabled 一律显式关闭 —— 与 DeepSeek/MiMo 的"服务端默认开启,
|
||||
// 必须显式发送 disabled"口径对齐,让行为确定性不依赖服务端隐式默认。
|
||||
const wantThinking =
|
||||
request.params.thinkingEnabled === true && effort !== 'low' && modelThinkingSupported;
|
||||
const wantThinking = request.params.thinkingEnabled === true && effort !== 'low';
|
||||
body.chat_template_kwargs = { enable_thinking: wantThinking };
|
||||
if (request.params.thinkingEnabled === true && !modelThinkingSupported) {
|
||||
if (
|
||||
request.params.thinkingEnabled === true &&
|
||||
wantThinking &&
|
||||
AgnesAdapter.MODEL_INFO[this.config.defaultModel]?.supportsThinking === false
|
||||
) {
|
||||
log.warn(
|
||||
`[Agnes] model "${this.config.defaultModel}" does not support thinking — sending enable_thinking:false (P0-3 capability gate)`,
|
||||
`[Agnes] model "${this.config.defaultModel}" metadata says thinking unsupported — sending enable_thinking per user config (degraded retry handles budget exhaustion)`,
|
||||
);
|
||||
}
|
||||
}
|
||||
|
||||
@@ -203,13 +203,12 @@ export class DeepSeekAdapter extends OpenAICompatibleAdapter {
|
||||
}
|
||||
|
||||
// Thinking 模式
|
||||
// v0.8.0 P0-3 根治: 模型能力门控 —— MODEL_INFO.supportsThinking === false 的
|
||||
// 模型(如 deepseek-v4-flash-vision-exp)一律不发思考参数并显式 disabled,
|
||||
// 防止思考消耗输出预算(生产事故:vision-exp 8192 输出预算被 max 档思考
|
||||
// 全部烧光 → finish_reason=length 空回复 → 会话静默停止)。
|
||||
const modelThinkingSupported =
|
||||
DeepSeekAdapter.MODEL_INFO[this.config.defaultModel]?.supportsThinking !== false;
|
||||
const wantThinking = request.params.thinkingEnabled === true && modelThinkingSupported;
|
||||
// v0.8.0 修订(用户意图优先): 思考参数完全遵循用户配置,不再按
|
||||
// supportsThinking 元信息硬门控 —— 事故复盘中 vision-exp 元信息标注
|
||||
// "不支持思考"、实际却产生了推理内容,元信息不可靠。预算耗尽风险由
|
||||
// 引擎空响应守卫的降级重试链路兜底(关闭思考重试一次 → 仍失败则
|
||||
// OUTPUT_LENGTH_EXCEEDED 明确报错)。元信息与配置不符时仅告警不拦截。
|
||||
const wantThinking = request.params.thinkingEnabled === true;
|
||||
// API 默认 thinking.type = "enabled",必须显式发送 disabled 才能关闭
|
||||
if (!wantThinking) {
|
||||
body.thinking = { type: 'disabled' };
|
||||
@@ -223,6 +222,12 @@ export class DeepSeekAdapter extends OpenAICompatibleAdapter {
|
||||
};
|
||||
// DeepSeek API 仅支持 high / max 两档,low/medium 映射为 high
|
||||
body.reasoning_effort = effortMap[request.params.thinkingEffort ?? 'high'] ?? 'high';
|
||||
// 元信息标注不支持思考但用户开启 —— 告知降级兜底路径(不拦截)
|
||||
if (DeepSeekAdapter.MODEL_INFO[this.config.defaultModel]?.supportsThinking === false) {
|
||||
log.warn(
|
||||
`[DeepSeek] model "${this.config.defaultModel}" metadata says thinking unsupported — sending thinking params per user config (degraded retry handles budget exhaustion)`,
|
||||
);
|
||||
}
|
||||
// v0.8.0 P0-3: 思考会占用输出预算 —— 钳制后预算过小时显式告警
|
||||
//(思考 token 计入 max_tokens,预算过小会出现"思考耗尽正文为零"截断)
|
||||
if (maxTokens < 8192) {
|
||||
|
||||
@@ -126,11 +126,10 @@ export class MimoAdapter extends OpenAICompatibleAdapter {
|
||||
|
||||
// Thinking 模式(与 DeepSeek 参数结构一致)
|
||||
// MiMo API 默认 thinking.type = "enabled",必须显式发送 disabled 才能关闭
|
||||
// v0.8.0 P0-3: 模型能力门控 —— supportsThinking===false 的模型强制 disabled
|
||||
//(思考 token 计入 max_completion_tokens,能力不符的模型上会耗尽输出预算)
|
||||
const modelThinkingSupported =
|
||||
MimoAdapter.MODEL_INFO[this.config.defaultModel]?.supportsThinking !== false;
|
||||
const wantThinking = request.params.thinkingEnabled !== false && modelThinkingSupported;
|
||||
// v0.8.0 修订(用户意图优先): 思考参数完全遵循用户配置,不再按
|
||||
// supportsThinking 元信息硬门控 —— 预算耗尽风险由引擎空响应守卫的
|
||||
// 降级重试链路兜底;元信息与配置不符时仅告警不拦截。
|
||||
const wantThinking = request.params.thinkingEnabled !== false;
|
||||
if (!wantThinking) {
|
||||
// 显式禁用思考:传 disabled + temperature/top_p(非思考模式下这两个参数有效)
|
||||
body.thinking = { type: 'disabled' };
|
||||
@@ -140,6 +139,12 @@ export class MimoAdapter extends OpenAICompatibleAdapter {
|
||||
// 启用思考(包括 undefined,因为 MiMo 默认 enabled)
|
||||
// 思考模式下 temperature/top_p 被 API 强制覆盖为 1.0/0.95,不传
|
||||
body.thinking = { type: 'enabled' };
|
||||
// 元信息标注不支持思考但用户开启 —— 告知降级兜底路径(不拦截)
|
||||
if (MimoAdapter.MODEL_INFO[this.config.defaultModel]?.supportsThinking === false) {
|
||||
log.warn(
|
||||
`[MiMo] model "${this.config.defaultModel}" metadata says thinking unsupported — sending thinking params per user config (degraded retry handles budget exhaustion)`,
|
||||
);
|
||||
}
|
||||
// v0.8.0 P0-3: 思考占用输出预算 —— 钳制后预算过小时显式告警
|
||||
const effectiveMax = body.max_completion_tokens as number;
|
||||
if (typeof effectiveMax === 'number' && effectiveMax < 8192) {
|
||||
|
||||
@@ -701,10 +701,13 @@ export class OllamaAdapter extends BaseAdapter {
|
||||
}
|
||||
|
||||
// Thinking 模式
|
||||
// v0.8.0 P0-3: 模型能力门控 —— /api/show capabilities 探测为不支持思考
|
||||
//(cachedThinkingSupport === false)时不发 think 参数(Ollama 服务端默认关闭);
|
||||
// 未探测/探测失败(null)fail-open 放行,与 listModels 能力回退策略一致。
|
||||
// 探测在适配器实例创建时 fire-and-forget 发起(refreshContextWindow)。
|
||||
// v0.8.0 P0-3(v0.8.0 修订后保留的唯一门控): /api/show capabilities 探测为
|
||||
// 不支持思考(cachedThinkingSupport === false)时不发 think 参数 —— 与云端
|
||||
// Provider 不同,这是 Ollama 服务端的**硬协议约束**(向无思考能力的模型发
|
||||
// think 会导致每次请求 400 "does not support thinking",而非静默忽略),
|
||||
// 故此处门控属协议正确性而非用户意图覆盖;探测为服务端实时真值(非静态
|
||||
// 元信息)。未探测/探测失败(null)fail-open 放行,与 listModels 能力回退
|
||||
// 策略一致。探测在适配器实例创建时 fire-and-forget 发起(refreshContextWindow)。
|
||||
if (request.params.thinkingEnabled) {
|
||||
const modelThinkingSupported = this.cachedThinkingSupport !== false;
|
||||
if (modelThinkingSupported) {
|
||||
@@ -724,7 +727,7 @@ export class OllamaAdapter extends BaseAdapter {
|
||||
}
|
||||
} else {
|
||||
log.warn(
|
||||
`[Ollama] model "${this.config.defaultModel}" does not support thinking (per /api/show capabilities) — omitting think parameter (P0-3 capability gate)`,
|
||||
`[Ollama] model "${this.config.defaultModel}" does not support thinking (per /api/show capabilities) — omitting think parameter (server would reject with 400 otherwise)`,
|
||||
);
|
||||
}
|
||||
}
|
||||
|
||||
@@ -202,7 +202,8 @@ registerTranslations('zh-CN', {
|
||||
'llm.maxTokens.minError': '最小值为 256',
|
||||
'llm.maxTokens.exceedCap': '当前模型输出上限为 {{cap}},保存后将按模型上限生效(配置值被钳制)',
|
||||
'llm.maxTokens.capInfo': '当前模型输出上限:{{cap}} tokens',
|
||||
'llm.thinking.unsupported': '当前模型不支持思考模式:请求将自动关闭思考(避免思考耗尽输出预算)',
|
||||
'llm.thinking.unsupported':
|
||||
'当前模型元信息标注不支持思考:仍按你的配置发送思考参数;若思考耗尽输出预算,会自动关闭思考重试一次',
|
||||
'llm.pull.title': '下载 Ollama 模型',
|
||||
'llm.pull.placeholder': '模型名,如 qwen3:8b',
|
||||
'llm.pull.download': '下载',
|
||||
@@ -915,7 +916,7 @@ registerTranslations('en-US', {
|
||||
'This model caps output at {{cap}} — the saved value will be clamped to the model limit',
|
||||
'llm.maxTokens.capInfo': 'Model output cap: {{cap}} tokens',
|
||||
'llm.thinking.unsupported':
|
||||
'This model does not support thinking: requests will disable thinking automatically (to avoid burning the output budget on reasoning)',
|
||||
'Model metadata marks thinking as unsupported — your setting is still sent; if reasoning exhausts the output budget, one degraded retry (thinking off) runs automatically',
|
||||
'llm.pull.title': 'Download Ollama model',
|
||||
'llm.pull.placeholder': 'Model name, e.g. qwen3:8b',
|
||||
'llm.pull.download': 'Download',
|
||||
|
||||
Reference in New Issue
Block a user