feat: v0.8.1 记忆深化 · 观测闭环 · 体验收口 — 窗口/输出上限全局单一配置 · 2478 用例全量回归 + E2E 冒烟
硬性契约:删除代码中一切写死的上下文窗口与最大输出上限(含六家模型元信息
钳制与全部兜底值)——唯一合法来源是设置面板「上下文长度」(llm.contextWindow)
与「最大输出上限」(llm.maxTokens),跨 Provider/模型原样透传。
P0 正确性收口:
- 迁移 11/12(SCHEMA_VERSION 5):记忆表 embedding 列 + 分 Provider 窗口键清理
- 记忆生命周期接线:会话终态清理 working memory / episodic 90 天 TTL / access_count 回写
- 回放缓冲模块化 + 会话终态清理(杜绝 4MB/会话内存滞留)
- i18n 收口:主进程 main-locale(zh/en,ui.locale 热切换)+ 渲染层 17 处出层
P1 能力演进:
- 本地向量混合检索:0.6×向量余弦 + 0.4×TF-IDF,Ollama embeddings 首次投产,
存量记忆惰性回填,嵌入不可用自动回退 TF-IDF
- MEMORY.md 维护闭环:固化去重消除截断盲区;两阶段维护(AI 建议 → 用户确认 →
原子改写 + 语义记忆双轨同步 + 审计);>50KB 告警
- 可观测闭环:cacheTokens 引擎→前端透传(Token 面板命中率/成本行)+ 输入框
上下文占用指示条
- MCP Prompts/Resources 对话可用:/mcp:{server}:{prompt} 与 @mcp:{server}:{uri}
P2 体验补全:
- 工具自定义策略(正则白/黑名单 + 频率 + 强制确认,热生效)
- 连续 ≥3 同类工具确认聚合为单弹框
- 会话消息游标分页(首屏 200 条向上翻页)
- 开机自启;Playwright + Electron E2E 冒烟(本地 mock LLM 零外联)
Review 回归修复:MCP 大小写失配 / 分页状态复位 / 清空=未配置语义(Number(null)=0
隐患)/ MEMORY.md 告警位置 / working_memories FK(迁移 13)/ 全局配置层废键清理;
附带根治权限加固启动时序、代理回环放行、safeStorage 降级、悬空 symlink 逃逸。
验证:typecheck/lint 0 问题;test:electron 2478/2478(0 跳过);E2E 2/2;
docs/v0.8.1-迭代实施清单.md 全项留档。
This commit is contained in:
@@ -24,39 +24,33 @@ export class OpenAIAdapter extends OpenAICompatibleAdapter {
|
||||
readonly supportsToolCalling = true;
|
||||
readonly supportsThinking = true;
|
||||
|
||||
// v0.8.1: 仅承载展示与能力声明 —— 窗口/输出上限数值已按硬性契约删除,
|
||||
// 唯一合法来源是设置面板 llm.contextWindow / llm.maxTokens
|
||||
private static readonly MODEL_INFO: Record<string, MetonaModelInfo> = {
|
||||
'gpt-4o': {
|
||||
id: 'gpt-4o',
|
||||
name: 'GPT-4o',
|
||||
contextWindow: 128_000,
|
||||
maxOutputTokens: 16_384,
|
||||
supportsToolCalling: true,
|
||||
supportsThinking: false,
|
||||
description: 'OpenAI 旗舰多模态模型,128K 上下文',
|
||||
description: 'OpenAI 旗舰多模态模型',
|
||||
},
|
||||
'gpt-4o-mini': {
|
||||
id: 'gpt-4o-mini',
|
||||
name: 'GPT-4o mini',
|
||||
contextWindow: 128_000,
|
||||
maxOutputTokens: 16_384,
|
||||
supportsToolCalling: true,
|
||||
supportsThinking: false,
|
||||
description: 'OpenAI 高性价比模型,128K 上下文',
|
||||
description: 'OpenAI 高性价比模型',
|
||||
},
|
||||
'gpt-4.1': {
|
||||
id: 'gpt-4.1',
|
||||
name: 'GPT-4.1',
|
||||
contextWindow: 1_000_000,
|
||||
maxOutputTokens: 32_768,
|
||||
supportsToolCalling: true,
|
||||
supportsThinking: false,
|
||||
description: 'OpenAI 长上下文模型,1M 上下文',
|
||||
description: 'OpenAI 长上下文模型',
|
||||
},
|
||||
'o3-mini': {
|
||||
id: 'o3-mini',
|
||||
name: 'o3-mini',
|
||||
contextWindow: 200_000,
|
||||
maxOutputTokens: 100_000,
|
||||
supportsToolCalling: true,
|
||||
supportsThinking: true,
|
||||
description: 'OpenAI 推理模型,支持 reasoning_effort',
|
||||
@@ -81,11 +75,6 @@ export class OpenAIAdapter extends OpenAICompatibleAdapter {
|
||||
return 'OpenAI';
|
||||
}
|
||||
|
||||
// v0.6.4: OpenAI 家族兜底窗口为 128K(其余 OpenAI 兼容 Provider 为 1M)
|
||||
protected override defaultContextWindowFallback(): number {
|
||||
return 128_000;
|
||||
}
|
||||
|
||||
// ===== GET /v1/models =====
|
||||
|
||||
override async listModels(): Promise<MetonaModelInfo[]> {
|
||||
@@ -137,18 +126,13 @@ export class OpenAIAdapter extends OpenAICompatibleAdapter {
|
||||
};
|
||||
|
||||
// Token 上限参数:o 系列/gpt-5 使用 max_completion_tokens
|
||||
// v0.5.3: 按模型上限钳制(gpt-4o 16384 / gpt-4.1 32768 / o3-mini 100000)—
|
||||
// 引擎默认 63488 超过 gpt-4o/gpt-4.1 上限时 API 直接 400
|
||||
const oaMaxOutput = OpenAIAdapter.MODEL_INFO[model]?.maxOutputTokens ?? 128_000;
|
||||
const oaMaxTokens = Math.min(
|
||||
request.params.maxTokens ?? (isReasoningModel ? 32_768 : oaMaxOutput),
|
||||
oaMaxOutput,
|
||||
);
|
||||
if (oaMaxTokens) {
|
||||
// v0.8.1 硬性契约: 原样透传设置面板「最大输出上限」(llm.maxTokens),删除了
|
||||
// 旧的按模型元信息钳制逻辑与未配置时的 32_768 兜底 —— 未配置时不下发该字段。
|
||||
if (request.params.maxTokens != null) {
|
||||
if (isReasoningModel) {
|
||||
body.max_completion_tokens = oaMaxTokens;
|
||||
body.max_completion_tokens = request.params.maxTokens;
|
||||
} else {
|
||||
body.max_tokens = oaMaxTokens;
|
||||
body.max_tokens = request.params.maxTokens;
|
||||
}
|
||||
}
|
||||
|
||||
@@ -169,10 +153,10 @@ export class OpenAIAdapter extends OpenAICompatibleAdapter {
|
||||
max: 'high',
|
||||
};
|
||||
body.reasoning_effort = effortMap[request.params.thinkingEffort ?? 'high'] ?? 'high';
|
||||
// v0.8.0 P0-3: 推理 token 计入 max_completion_tokens —— 钳制后预算过小时告警
|
||||
if (oaMaxTokens < 8192) {
|
||||
// v0.8.0 P0-3: 推理 token 计入 max_completion_tokens —— 用户配置的预算过小时告警
|
||||
if (typeof request.params.maxTokens === 'number' && request.params.maxTokens < 8192) {
|
||||
log.warn(
|
||||
`[OpenAI] reasoning enabled with small output budget (${oaMaxTokens} tokens after model clamp) — reasoning may consume the entire budget and truncate the answer`,
|
||||
`[OpenAI] reasoning enabled with small output budget (${request.params.maxTokens} tokens per user config) — reasoning may consume the entire budget and truncate the answer`,
|
||||
);
|
||||
}
|
||||
} else if (!isReasoningModel) {
|
||||
|
||||
Reference in New Issue
Block a user