图片不该总由主 Agent 直接读取
密集页面、批量截图与复杂版面会持续占用视觉输入。视觉观察独立后,主 Agent 的上下文可以留给判断、组织和任务推进。
它不是新的大模型,而是视觉任务的编排接口:先让合适的视觉模型观察,再让 Codex 负责结构化整理、推理与后续行动。
密集页面、批量截图与复杂版面会持续占用视觉输入。视觉观察独立后,主 Agent 的上下文可以留给判断、组织和任务推进。
综合视觉理解、整页 OCR、表格版面和普通界面检查可以按任务走不同路线,下游仍接收统一结构。
不绑定单一模型;保存观察、用量和不确定性;让视觉结果能够被校验、复用和审计。
视觉模型看见,Codex 理解并组织;两层各自承担擅长的工作。
任务类型、隐私边界与目标结构先被明确。
综合理解走 VLM;长文档与版面 OCR 可走专用 OCR-VL。
保留置信度、不可读项和用量,不把推断冒充原文。
把视觉观察接回 Schema、研究流程、代码或文档任务。
有 DOM、文本或数据源时先用非视觉证据;需要界面状态、版面、图表或图像内容时才进入视觉层。
不是比较谁永远更强,而是根据综合理解、整页 OCR、批量筛选和隐私要求选择路线。
视觉结果是观察层,不是最终真相;高影响结论必须与原图、DOM、文本或代码交叉验证。
Schema 整理、因果判断、任务推进、文件修改与最终责任留在主 Agent。
选择任务,观察路线为什么发生变化。
关键不是把字全部抄出,而是同时区分可见原文、结构关系与不确定推断。
没有目标 Schema,视觉模型容易返回漂亮但无法评分的描述。
不可读内容可以推断,但必须保留依据和不确定性。
金额、日期、编号、人物和章印的错误权重通常高于一般措辞。
阅读顺序和版面结构先被恢复,再交给 Codex 生成统一字段。
栏序和表格关系错了,即使字符大多正确,整页语义仍可能失真。
长文档 OCR 看结构恢复;章印与上下文任务更看综合视觉能力。
计费、提供方 usage 与整链路 Token 必须保持口径标签。
按钮、空状态、报错与危险操作被整理成观察,不替代 DOM 与代码验证。
视觉层先回答“屏幕上有什么”,不直接决定是否点击。
截断、重叠和可见状态可以由截图发现,再用几何与代码核对。
看见表单不等于获得提交、上传或发送敏感数据的授权。
批量任务使用索引、缩略联系表和结构化返回,避免逐张盲目消耗上下文。
联系表承担初选,原图只用于高价值候选与歧义核验。
编号让选择可以映射回原文件,并留下可复核轨迹。
重试、裁切和放大应围绕一个高影响问题,而不是重新看全部内容。
Duhai Vision 实验把“直接看图”改造成“准备视觉输入—选择提供方—保存观察—交给 Codex 编排”的工程链。