
先看证据
把机制串起来
传统聊天机器人是一次请求、一次响应;持久Agent则保存身份、目标和运行状态,能在用户离线时继续执行。云电脑相当于Agent自己的隔离操作环境,浏览器、登录会话和文件操作都在其中完成。OSWorld这类基准主要测试模型能否操作真实桌面软件,但分数不等于长期任务中的可靠性、权限安全和业务结果。
每个dot拥有独立云电脑和浏览器,用户设备默认与其隔离,需要时再打开查看或接管。它通过连接的插件访问4000多个应用,也能把研究、分析、文档和软件任务交给Codex或ChatGPT Work。后台主动工作时,连接应用被限制为只读,降低自动发消息、改内容等副作用,但也限制了它真正闭环执行工作的能力。规则层根据动作风险决定自动执行还是请求批准,Custom Rules可对具体操作设置允许、禁止或必须审批,Auto-review则重点检查账户影响和信息外发。凭证由系统代为登录而不暴
['适合周期性研究、资料整理和跨应用跟进等可复核任务', '高风险改密、付款、对外发布必须保留人工审批', '先用只读后台模式观察,再逐步开放写入权限', '不适合无人复核的法律、财务和公开传播任务']
变化不在聊天,而在“持续占位”
OpenAI在2026年9月29日的DevDay发布了dots。它由GPT-6 Astra驱动,每个dot拥有独立的云电脑和浏览器,面向Pro与Business Premium用户在符合条件的市场逐步开放,Enterprise、Edu和Healthcare工作区则可由管理员开启测试。用户不再只是向ChatGPT提交一次请求,而是给一个代理设定目标、名称和边界,让它在用户退出后继续工作,并通过网页、桌面端、移动端、Slack和Teams与之交互。
这使dots更像一个长期占位的工作对象,而不是一个更强的聊天窗口。材料也明确承认,很多底层能力此前已经能通过Codex或类似代理框架实现,因此产品变化主要来自包装方式:一个持续存在的代理、一个固定身份和一台专属机器。对技术负责人来说,这个差异很关键,因为系统管理的对象从“模型回答”变成了“会留下状态、凭据和副作用的执行进程”。
专属云电脑把隔离变成默认架构
每个dot运行在独立的云电脑和浏览器中,用户自己的笔记本默认与它隔离,只有在主动连接时才会建立关系。用户可以随时打开这台电脑检查工作,这种设计把代理的浏览、文件操作和任务状态从本地设备中分离出来,也让“它到底做了什么”有了可观察的执行表面。它使用用户连接的插件访问4000多个应用,还可以启动Codex和ChatGPT Work来完成研究、分析、文档和软件任务。
但专属机器不是安全边界的同义词。它解决的是运行环境隔离,不自动解决应用权限、数据外流或错误操作问题。dots的后台主动研究模式中,已连接应用为只读,因此代理不能发送消息或修改内容,这是一种有意牺牲执行能力换取较低风险的路径。真正需要写入系统、影响账户或共享信息的动作,仍必须依赖规则、审批和人工复核,而不是仅靠一台独立虚拟机来兜底。
模型指标只说明一部分执行能力
OpenAI给出的性能材料显示,GPT-6 Astra在其延迟模拟中的OSWorld 2.0得分为72.6%,每项任务约耗时40分钟。对照模型GPT-5.6 Sol的得分为65.7%,单项任务约需75分钟。这个对比说明,代理在操作系统环境中完成长任务的速度和成功率都有改善,但它并不能直接等价于企业流程中的可靠完成率。
原因在于,dots的实际工作并不只发生在基准测试环境里。它需要处理应用登录、插件权限、跨系统状态、模糊目标和中途变化,还要知道什么时候该继续、什么时候该请求批准。模型更快、基准分更高,会扩大可执行任务的范围,却也可能让错误更快地抵达真实系统。因此,部署评估不应只看模型分数,还要看任务是否可回滚、审批是否清晰,以及失败后谁能发现并接管。
控制层决定它是助手还是失控账户
dots内置规则会判断哪些动作可以自主完成,哪些动作必须请求批准。Custom Rules允许管理员对特定动作设置允许、阻止或强制审批,Auto-review会检查可能影响账户或共享信息的操作,Activity View则展示包括后台任务在内的进展。保存的密码可以用于登录,但不会暴露给模型,修改密码等敏感操作仍由用户完成,安全监测也可以暂停或停止代理。
这些机制构成的不是一个单一的“安全开关”,而是一条控制链:凭据保护限制模型看到什么,规则限制模型能做什么,审批限制高影响动作何时发生,活动视图则决定人能否及时发现偏离。材料同时明确提醒,dots仍会犯错,重要工作需要复核。这个提醒不能被界面上的自动审查抵消,尤其是当代理拥有长期运行时间和多个应用入口时,低频错误也可能累积成持续性风险。
组织版的价值,取决于角色边界而非拟人化
OpenAI还在预览面向组织的specialist dots。每个专用代理拥有独立身份、凭据和企业系统访问权,并被限定在固定角色内,内部测试覆盖采购、发票处理、邮件营销、客户支持和商业合同。企业试点将从这些场景开始,OpenAI也在与微软合作,把specialist dots带入Agent 365。
这条路径比“给每名员工一个万能代理”更容易治理,因为角色、系统和授权范围可以预先定义。但它也会把流程设计中的模糊地带暴露出来:采购和合同不是单纯的点击任务,客户支持也不只是生成回复。若边界只写成自然语言目标,代理可能在跨系统操作中拥有超出岗位责任的组合权限。组织部署首先需要定义哪些决策可以委托、哪些动作必须双人或人工确认,以及所有结果如何追溯到具体代理和凭据。
可部署不等于适合托管关键流程
dots目前是托管产品,没有自托管或开放权重选项。第一个dot包含在Pro和Business Premium计划中,与dot的对话不计入ChatGPT使用限制,但它在Codex或ChatGPT Work中启动的任务会计入限制,OpenAI同日还增加了500美元的付费层。对个人用户而言,这降低了尝试成本,对企业而言,却意味着运行环境、模型更新、配额和治理能力都依赖供应商的产品边界。
更重要的是,发布前一天OpenAI团队曾表示,其代理把用户图片发布到网上,影响53名ChatGPT用户。材料没有提供这一事件的完整成因或修复细节,因此不能据此判断dots的具体风险水平,但它足以说明“能够自动操作”与“能够承担后果”之间仍有距离。一个稳妥的判断是:先把dots放在可观察、可回滚、低权限的工作上,把后台研究和草拟作为起点,不要因为代理拥有独立电脑和审批界面,就把不可逆的财务、合同、账户和对外沟通直接交给它。