Duhai Vision 实验:把视觉理解变成可插拔能力

它不是新的大模型,而是视觉任务的编排接口:先让合适的视觉模型观察,再让 Codex 负责结构化整理、推理与后续行动。

视觉层 ≠ 推理层
为什么做

图片不该总由主 Agent 直接读取

密集页面、批量截图与复杂版面会持续占用视觉输入。视觉观察独立后,主 Agent 的上下文可以留给判断、组织和任务推进。

做到了什么

同一入口,切换不同视觉提供方

综合视觉理解、整页 OCR、表格版面和普通界面检查可以按任务走不同路线,下游仍接收统一结构。

价值在哪里

把模型选择变成系统能力

不绑定单一模型;保存观察、用量和不确定性;让视觉结果能够被校验、复用和审计。

工作链路

视觉模型看见,Codex 理解并组织;两层各自承担擅长的工作。

输入图片、截图、文档页

任务类型、隐私边界与目标结构先被明确。

路由选择视觉提供方

综合理解走 VLM;长文档与版面 OCR 可走专用 OCR-VL。

观察输出可核对事实

保留置信度、不可读项和用量,不把推断冒充原文。

编排Codex 结构化整理

把视觉观察接回 Schema、研究流程、代码或文档任务。

输入方法先判断视觉是否真有必要

有 DOM、文本或数据源时先用非视觉证据;需要界面状态、版面、图表或图像内容时才进入视觉层。

路由方法任务类型决定提供方

不是比较谁永远更强,而是根据综合理解、整页 OCR、批量筛选和隐私要求选择路线。

观察方法输出事实、置信度与不可读项

视觉结果是观察层,不是最终真相;高影响结论必须与原图、DOM、文本或代码交叉验证。

编排方法视觉只负责看,Codex 负责把事情做完

Schema 整理、因果判断、任务推进、文件修改与最终责任留在主 Agent。

任务路由

选择任务,观察路线为什么发生变化。

Duhai VLM

章印、人物地点与上下文需要综合视觉理解

关键不是把字全部抄出,而是同时区分可见原文、结构关系与不确定推断。

经验先定义字段,再看图

没有目标 Schema,视觉模型容易返回漂亮但无法评分的描述。

纪律原文、复原、推断分开

不可读内容可以推断,但必须保留依据和不确定性。

验证关键数字与实体单独核对

金额、日期、编号、人物和章印的错误权重通常高于一般措辞。

这里说明思想

为什么要做这个 Skill,以及它改变了什么

Duhai Vision 实验把“直接看图”改造成“准备视觉输入—选择提供方—保存观察—交给 Codex 编排”的工程链。

实验结果展示 ↗