feat: v0.5.4 多模态增强 — 多轮图片记忆 + 多模态总开关 + DeepSeek vision 模型支持
CI / 类型检查 + Lint + 单元测试 (push) Failing after 5m47s
CI / 全量测试 (Electron ABI) (push) Failing after 5m25s
CI / 产物编译验证 (push) Successful in 10m4s

多轮图片记忆:
- 此前历史轮次的图片不回传 LLM(attachments 仅存压缩 preview,历史组装
  时被丢弃)— 跨轮对话中模型对图片内容"失忆"
- 修复:SessionSummaryService.buildHistoryMessages 从持久化的 attachments
  恢复 images(type=image 的 preview base64),历史图片随上下文回传
- Token 控制:最多注入最近 10 张(MAX_HISTORY_IMAGES,从最新消息向前
  收集)— 每张 1024px 压缩图约数百至千余 token,无上限会吃满上下文
- 摘要区间(summarizedUntilRowid 之前)的图片不恢复,符合滚动摘要语义

多模态总开关 llm.multimodalEnabled(默认关闭):
- 新配置项:CONFIG_DEFAULTS 种子 + 设置弹框 LLM 配置 Switch +
  首次引导向导 LLM 步骤 Switch(含说明文案)
- 上传入口双重判断:总开关 × 模型能力 — 未开启时即使模型支持多模态
  也不能上传图片(ChatInput 的选择/拖拽/粘贴统一拦截,Toast 区分
  "开关未开启"与"当前模型不支持"两种原因)
- 保存成功后同步 Agent Store 立即生效;App 启动时随 setProvider 加载

DeepSeek vision 模型支持:
- 新增 deepseek-v4-flash-vision-exp(OpenAI image_url content parts 格式,
  128K 上下文 / 8K 输出)
- adapter 按 isVisionModel() 判断:vision 模型将带 images 的消息转换为
  [{type:'text'},{type:'image_url'}] parts;非 vision 模型保持 images
  静默丢弃(防 API 400)

测试(236 → 243 用例):
- 多轮图片记忆 ×3(session-summary.test.ts):历史 attachments 恢复
  images / 上限 10 张从最新向前 / 摘要区间图片不恢复
- DeepSeek vision 请求格式 ×4(deepseek-vision.test.ts,契约级 mock
  fetch 断言请求体):image_url parts 转换 / 非 vision 模型丢弃 /
  max_tokens 钳制 8192 / 无图不转换
- 测试顺序修正:多轮图片用例置于 describe 末尾(插入新行消耗全局自增
  rowid,插在中间会破坏既有用例对 rowid 数值的断言)

文档: README 同步(DeepSeek 模型表 + vision 多模态列、llm.multimodalEnabled
配置项、多轮图片记忆特性行、243 用例数)

验证: lint 0 / typecheck 双工程 0 / test:electron 243 全过 / build 成功
This commit is contained in:
2026-08-21 23:00:20 +08:00
parent 3a30e8f5b4
commit 4ee5100661
12 changed files with 1363 additions and 353 deletions
@@ -91,7 +91,11 @@ describe.skipIf(!dbAvailable)('SessionSummary 分层上下文 × 截断交互',
});
afterAll(() => {
try { db?.close(); } catch { /* ignore */ }
try {
db?.close();
} catch {
/* ignore */
}
rmSync(dir, { recursive: true, force: true });
});
@@ -118,6 +122,9 @@ describe.skipIf(!dbAvailable)('SessionSummary 分层上下文 × 截断交互',
expect(history.length).toBe(3);
});
// ===== v0.5.4: 多轮图片记忆用例置于 describe 末尾(插入新行消耗全局自增 rowid,
// 若插在中间会破坏 inclusive=false 用例对 rowid 数值的断言) =====
it('截断清理摘要(缺陷 #1 回归):游标落在删除范围内时摘要被删', () => {
// 编辑重发第 2 条消息(rowid 2inclusive)→ 删除 rowid>=2 的 4 条
// 摘要游标为 3,落在 [2, ∞) 内 → 摘要必须被清理
@@ -159,4 +166,92 @@ describe.skipIf(!dbAvailable)('SessionSummary 分层上下文 × 截断交互',
expect(sessionService.truncateMessagesAfter('s_test', 'not_exist', true)).toBe(false);
expect(sessionService.getMessages('s_test').length).toBe(before);
});
/** 插入带 attachments 的用户消息(模拟 ChatInput 持久化形态) */
const insertMessageWithAttachments = (
sessionId: string,
id: string,
content: string,
attachments: Array<{ type: string; preview?: string; textContent?: string }>,
): void => {
db.prepare(
`INSERT INTO messages (id, session_id, role, content, attachments, created_at) VALUES (?, ?, 'user', ?, ?, ?)`,
).run(id, sessionId, content, JSON.stringify(attachments), Date.now());
};
it('多轮图片记忆:历史消息的图片 attachments 恢复为 images 回传', () => {
db.prepare(`DELETE FROM messages WHERE session_id = 's_img'`).run();
db.prepare(
`INSERT INTO sessions (id, created_at, updated_at, message_count) VALUES ('s_img', ?, ?, 0)`,
).run(Date.now(), Date.now());
insertMessageWithAttachments('s_img', 'img_m1', '第一轮带图', [
{ type: 'image', preview: 'data:image/jpeg;base64,ROUND1PIC' },
]);
insertMessageWithAttachments('s_img', 'img_m2', '第二轮无图', []);
insertMessageWithAttachments('s_img', 'img_m3', '第三轮带图', [
{ type: 'image', preview: 'data:image/jpeg;base64,ROUND3PIC' },
{ type: 'text', textContent: '文本附件不恢复为图片' },
]);
const history = summaryService.buildHistoryMessages('s_img');
// 第一轮的图片仍被恢复(多轮记忆修复点:此前历史消息 images 恒为 undefined
const round1 = history.find((m: any) => m.content === '第一轮带图');
expect(round1?.images).toEqual([{ url: 'data:image/jpeg;base64,ROUND1PIC', detail: 'auto' }]);
// 第三轮两张附件只恢复 image 类型
const round3 = history.find((m: any) => m.content === '第三轮带图');
expect(round3?.images).toEqual([{ url: 'data:image/jpeg;base64,ROUND3PIC', detail: 'auto' }]);
// 无图消息不带 images 字段
const round2 = history.find((m: any) => m.content === '第二轮无图');
expect(round2?.images).toBeUndefined();
});
it('多轮图片记忆:注入上限 10 张(从最新向前收集,更早的丢弃)', () => {
db.prepare(`DELETE FROM messages WHERE session_id = 's_cap'`).run();
db.prepare(
`INSERT INTO sessions (id, created_at, updated_at, message_count) VALUES ('s_cap', ?, ?, 0)`,
).run(Date.now(), Date.now());
// 12 条带图消息(每条 1 张)— 上限 10 张,最早的 2 条不注入
for (let i = 1; i <= 12; i++) {
insertMessageWithAttachments('s_cap', `cap_m${i}`, `${i}`, [
{ type: 'image', preview: `data:image/jpeg;base64,PIC${i}` },
]);
}
const history = summaryService.buildHistoryMessages('s_cap');
const withImages = history.filter((m: any) => m.images?.length > 0);
expect(withImages).toHaveLength(10);
// 保留的是第 3~12 轮(最新的 10 张)
const contents = withImages.map((m: any) => m.content);
expect(contents).not.toContain('第 1 轮');
expect(contents).not.toContain('第 2 轮');
expect(contents).toContain('第 12 轮');
});
it('多轮图片记忆:摘要区间内的图片不恢复(符合滚动摘要语义)', () => {
db.prepare(`DELETE FROM messages WHERE session_id = 's_sum_img'`).run();
db.prepare(
`INSERT INTO sessions (id, created_at, updated_at, message_count) VALUES ('s_sum_img', ?, ?, 0)`,
).run(Date.now(), Date.now());
for (let i = 1; i <= 3; i++) {
insertMessageWithAttachments('s_sum_img', `sm${i}`, `摘要区间第 ${i}`, [
{ type: 'image', preview: `data:image/jpeg;base64,OLDPIC${i}` },
]);
}
// 摘要覆盖前 3 条(含全部图片消息)
const cursor = (
db.prepare(`SELECT MAX(rowid) AS r FROM messages WHERE session_id = 's_sum_img'`).get() as {
r: number;
}
).r;
summaryService.saveSummary('s_sum_img', '早期含图对话的摘要', cursor);
insertMessageWithAttachments('s_sum_img', 'sm4', '摘要后的新消息(无图)', []);
const history = summaryService.buildHistoryMessages('s_sum_img');
// 摘要消息 + 1 条原文,均无图片(游标前的图片消息不在 tail 中)
expect(history).toHaveLength(2);
expect(history.every((m: any) => !m.images?.length)).toBe(true);
});
});