OpenAI 发布 Presence:企业 AI Agent 上线后怎么管,也做成了产品
- Presence 是企业用来部署、管理可信 AI Agent 的产品:回答问题、处理事务、接公司系统、执行已批准动作,需要时转人
- 每个部署只办一类活(账单、理赔、员工 IT 等);下文用「订阅重复扣费」客服案例,把权限、政策、模拟、改稿审批走一遍
- 上线前可以批量模拟;上线后 Codex 只提改稿建议,新版必须和线上版对比,再由人批准
- 今天对话通道先开实时语音和文字聊天;有限开放、驻场工程师带着装;价格未公布
企业 Agent 现在卡在上线之后
2026 年 7 月 22 日,OpenAI 发布企业产品 Presence。
先把词说清楚。这里的 Agent,指的是公司部署到真实业务里的 AI 助手:能回答问题、处理事务,按公司授权使用内部系统、执行已经批准的动作,遇到搞不定或高风险的情况再交给真人。它既可以对客户(账单、理赔),也可以对内部员工(例如 IT 报修)。Presence 要做的,是帮企业把这种助手装进业务,并且在真跑起来之后还能管得住、改得动。
每个 Presence 部署都从一个具体岗位开始,例如处理账单争议、协助保险理赔、处理员工 IT 服务请求。助手只拿到这个岗位需要的知识和系统权限;公司规定它能做什么、什么时候要人批、什么时候必须转人。
过去两三年,很多公司已经试过类似能力。在会议室里接个模型,让它和人对练几句「你好,我要查订单」,听起来像那么回事。发布会、内部试点也常停在这一步:对话顺、语气像人,大家觉得「AI 能聊了」。
助手一旦进入真实业务,情况就不一样了。对方要的是把事办完,例如把重复扣费退掉,而不是再听一遍礼貌话术。它得连上公司的订单系统、账单系统,按政策办事。规则一改,会不会乱操作?权限开大了,会不会动到不该动的账户?上线前有没有用真实难单练过?线上翻车了谁负责改、改完会不会更糟?Presence 针对的,就是这一串「聊得通」之后还没解决的问题。后文会用一条「订阅重复扣费」的客服案例把这些能力摊开讲;案例只是展示路径,产品本身面向多类企业岗位。今天对话入口先开实时语音和文字聊天。
客户要的是「重复扣费请退我」,不是再听一遍礼貌话术。Agent 得接上公司的订单系统、账单系统,按政策执行动作。只接模型、不接系统和规矩,停在聊天机器人。
权限开太大,Agent 可能改到不该改的账户;开太小,查不到订单、办不了退款,只能一直转人工。Presence 的做法是:每个岗位只给这件活要用的知识和接口。
演示用几条理想对话,扛不住真实客服里的骂街、重复来电、政策边界、诈骗话术。Presence 上线前可以批量跑模拟单,用打分器检查结果、政策、工具和是否该转人。
退款政策一改、新产品一上、用户说法一变,Agent 就得跟着改。Presence 不让 Agent 自己改线上自己:编程助手 Codex 提建议,团队拿新版和正在跑的版本比一轮,人批准后再上。
跟着一通「重复扣费」电话,看 Presence 怎么干活
产品能力是通用的:按岗位部署 Agent,接系统、守政策、能办事、能转人。为了讲清楚,下面用产品界面里的一条示意案例走全程。岗位是客服,通道是电话和文字。虚构电商 Swiftcart,客户说订阅被扣了两次。从听懂到退款,一步步看 Presence 在真实会话里靠什么能力。
听懂客户在说什么
能力:实时语音 / 文字聊天客户可以打电话,也可以打字。Presence 今天先支持这两种实时对话通道。电话里 Agent 边听边回;聊天里一条条接。
这一步的产出很具体:把「我被扣了两次订阅费」收成一件可处理的工单意图,停在闲聊不算办完。
确认是账户本人
能力:核实来电者 / 账户上下文退款动真钱,先确认对方是账户本人。Agent 会用公司规定的核身方式(示意里会用到账户上下文),通过之后才往下查账单。
核不过或迹象异常,就不要继续执行退款,按规则转人。
去公司系统里查订单和账单
能力:批准过的工具调用 · 最小权限示意里 Agent 调用的是「查询订单状态」(LOOKUP ORDER STATUS),查到重复扣费,后面才能退。文字侧同一工具会带出发票编号卡。
它拿不到全公司所有系统。这个岗位只接客服要用的接口:查订单、查账单、在限额内退款。没接上的系统,它动不了。
用公司的退款规则判断能不能退
能力:政策与标准作业程序 · 护栏查到重复扣费之后,还要套公司政策:这种单是否允许自动退、额度多少、要不要二次确认。政策写进 Presence,Agent 按规矩走。
对话一旦滑出边界(例如客户要改不在授权里的敏感资料),护栏可以拦住,不让它硬办。
执行已经批准的退款动作
能力:批准动作(approved actions)示意里 Agent 对客户说会处理退款,并进入「PROCESSING REFUND」。这句话对应的是公司事先列进「可以执行」清单的动作,随口答应办不到。
没列进清单的动作,它做不了。想加新动作,要改配置、再测、再上线,不能现场发明。
搞不定或风险高,交给真人
能力:转人工规则金额超限、身份对不上、客户情绪升级、政策覆盖不到,都该转人。Presence 把「什么时候必须由人接手」写成规则,而不是靠 Agent 自觉。
转人工本身也是产品能力:会话上下文一起交过去,避免客户把故事讲第三遍。
像给新客服开第一天工号:只能进客服相关系统,只能办限额内退款,超标或扯皮就转主管。不是一把总钥匙再口头叮嘱「你自己小心」。
Presence 到底装了哪些零件
把上面那通退款电话拆开,零件就齐了。同一套零件可以装到别的岗位上:账单客服、保险理赔、员工 IT 报修,共享政策模板和评测方式,各自改岗位权限和可用动作。案例是客服,产品不限于客服。
今天已开通的对话入口:打电话或打字都能进同一套处理逻辑。邮件等其它通道是否已开通,目前没有明确承诺。
每个部署只办一类活,只接这类活需要的数据和接口。
退不退、怎么退、话术边界,写成可执行规则。
对话越界时介入,挡住不该办的事。
退款、改订阅等必须事先点名授权,Agent 不能现场发明动作。
规则触发时把会话和上下文交给人。
上线前用假单批量演练,检查结果、政策、工具、是否该升级。
上线后根据生产信号提改稿建议,对比线上版后由人批准。
退款政策改了:先模拟,再让 Codex 提案
还是沿着上面的客服案例。假设公司把「年度退款规则」改了:重复订阅怎么处理、骂人是不是危机单,都要更新。Presence 不会直接把改动灌进正在接电话的 Agent。
先做模拟(simulation):用一批假的、但贴近真实的请求压过去。打分器(grader)看每组过没过,结果对不对、有没有违规、工具用对了没有、该不该转人。
Agent 已经在接真电话之后,系统继续盯:会话质量、转人工比例、客户在问什么。哪里开始吃力,编程助手 Codex 装上 Presence 插件会去查,并写出改稿建议。团队把建议版和正在跑的线上版放一起测,人点批准,才换上去。
顺序固定:生产信号 → Codex 写出建议 → 新版对比线上版 → 人工批准。线上 Agent 不能自己覆盖自己。
OpenAI 自己的电话线,和三家在试的企业
Presence 的生产实例里,OpenAI 先用在自己身上。英文电话支持线 1-888-GPT-0090 已跑在 Presence 上:开放式请求、核身、账户上下文、批准动作。OpenAI 自报:约 75% 进线不用真人;Codex 改进环在 10 天内把转人工再降 15 个百分点。这是同一产品装在「自家客服」这个岗位上的结果,产品本身不限于客服。
| 谁 | 到哪一步 | 在试什么 |
|---|---|---|
| OpenAI 自用 | 已在生产 | 英文电话支持 |
| BBVA | 设计伙伴 · 探索中 | 墨西哥日常银行语音支持 |
| SoftBank | 测试中 | 日语客户对话 |
| IAG | 探索中 | 极端天气等高峰期的及时支持 |
只有 BBVA 明确是设计伙伴;SoftBank、IAG 分别是测试和探索。都不是「已经全量换掉现有客服中心」。
Presence 到底是什么,干什么用
如果只带走一件事,可以记这句:
它是 OpenAI 卖给企业的通用产品:帮你部署可信的 AI Agent,并在真业务里长期管住它。Agent 能回答问题、处理事务、使用公司系统、执行已批准动作,需要时转给真人。每个部署只对准一个具体岗位(客户侧或内部都行);公司定政策与权限;上线前可模拟,上线后可用 Codex 提案、对比、人批再改。
它不是什么:它不是又一个只会聊天的网页机器人,也不是给个人用的 ChatGPT 会员功能。个人用户点不开;公司也不能在网页上自助开通。它也不是「只能做语音客服」的单点工具。语音与文字是今天已开通的对话通道;客服电话是最完整的公开案例,账单、理赔、员工 IT 等都可以各自开一个部署。
意义在哪:过去很多公司已经证明「AI 能和人说话」。Presence 要解决的是下一步:助手真接到业务之后,权限谁定、规则谁写、上线前练没练、线上出问题谁改、改完会不会把线上搞坏。OpenAI 把这些原先要自己拼的政策、模拟、看板、改稿审批,收成一套产品,并派工程师驻场帮企业装进真实流程。
具体有什么用:对业务或运营负责人,可以把它想成给某个岗位的 AI 助手配的「工号 + 权限表 + 上岗考试 + 质检改稿流程」。岗位可以是对客的,也可以是对内的:
只给这一岗需要的知识和系统接口,列好能执行的动作(比如限额内退款)。
政策、护栏、转人工规则写死;越权办不了,搞不定交给人。
用模拟单和打分器压常见单、难单,过了再接真实业务。
看板看哪里翻车;Codex 提改法;新版和线上版对比后,人批准再换。
前面「订阅被扣两次」的完整走法,是用客服岗位把这四块演示了一遍。读到这里,你心里应该有一张完整图:Presence 管的是企业 AI Agent 从装上线到持续改规矩的全过程,重点在「可控地办事」;语音和聊天是今天的对话入口,客服案例是讲解用的一条路径,不是产品边界的全部。
谁能用上,还缺哪些信息
Presence 现在是有限开放:企业客户找 OpenAI 谈,由驻场实施工程师(Forward Deployed Engineer,FDE)和少数系统集成商一起装,选流程、接系统、定权限、测完再进生产。不能网页自助开通。资格门槛和商务条款没有公开清单。
核心 Agent 必须用 OpenAI 模型
可以接第三方模型和服务
实时语音 + 文字聊天
软件费、人天、区域均未公开
已经在用 OpenAI API 自己做语音的客户,API 这条线继续保留。Presence 是另一条「产品 + 驻场」路径:政策、模拟、评测、批准、上线后改动,收在同一套界面里。
同一时期 OpenAI 还披露过评测环境里模型逃逸触及外部系统的安全事件。Presence 强调政策、模拟和人工批准,针对的是可控上线;不能把它理解成已经修过那起事故。本站另有专文。
OpenAI 发布 Presence:企业 AI Agent 上线后怎么管,也做成了产品
面向客户侧与内部流程;按岗位给权限、先模拟再上线、改规矩要人批。OpenAI 自用电话线自报 75% 不用真人,一页带图讲完。
↓ 一页读完 · 有一张会动的图
Presence 是 OpenAI 卖给企业的产品:帮公司部署可信的 AI Agent(能办事的 AI 助手),并在真业务里长期管住它。它能回答问题、接公司系统、执行已批准的动作,搞不定就转真人。今天对话通道先开实时语音和文字聊天。
✘ 真接到退款单时,往往缺系统权限、政策、上线前演练、改稿审批
会议室试点停在「能聊」;客户要的是把重复扣费退掉。规则一改谁改、改完会不会搞坏线上,过去要企业自己拼。
每个部署只办一类活:账单争议、保险理赔、员工 IT 报修都行。助手只拿这岗需要的知识和接口;公司写死能做什么、什么时候要人批、什么时候必须转人。上线前批量跑模拟单;上线后 Codex(编程助手)只提改稿建议,新版必须对照线上版,再由人批准。
上线后靠工单改 prompt
改完谁验、谁签字靠口头
模拟过线才接真单
Codex 只提案,人批准才换版
用小互给虚构电商 Swiftcart 装「订阅被扣两次」客服岗,把上线前和上线后串成一条环:权限与政策先定死,模拟过了再接真电话;线上出信号后,Codex 带着 Presence 插件写建议,团队对比生产版,人点批准才换上去。Agent 不能自己覆盖自己。
OpenAI 先把自家英文电话支持线 1-888-GPT-0090 跑在 Presence 上。对外设计伙伴 BBVA 在探索墨西哥银行语音支持;SoftBank 测试日语客户对话;IAG 探索极端天气等高峰支持,均为探索或测试,不是全量替换现有客服中心。
活是「重复扣费」退款。
演示里能聊几句查订单。
- × 没接退款系统
- × 没写清政策
- × 没上线前演练
- × 改稿谁签字?
规则一改谁改、改完会不会搞坏线上,过去全靠企业自己拼。
一类活
只拿这岗的知识
和接口权限
语音和文字先开。
能做什么、何时要人批,写在岗上。
常见单、边界单批量跑。
打分器看对不对、有没有越权。
接真进线
再干活
转人工突然变多。
系统盯着生产信号。
对照线上版
点批准才换
→提案
→对比
→批准
政策变了:重跑模拟,再让 Codex 提案;人签字,才换版。
进线无需真人即解决
OpenAI 英文电话线
1-888-GPT-0090 · 自报
10 天 · 转人工再降
Codex 改进环上线后
OpenAI 自报
按岗位给权限、先模拟再上线、
改规矩要人批。
75% 与 15pp 为 OpenAI 自报;价格未公布。
終BBVA · SoftBank · IAG
探索或测试阶段
不能网页自助开账号
核心模型须用 OpenAI