OpenAI Workspace Agents拆解:一句话给团队造Agent,共享运行与合规治理的企业落地
从一条Slack提问说起:Scout如何十秒汇总一周反馈
九月十三日凌晨开放Workspace Agents,直接集成进聊天应用侧边栏。
用户只说一句话,就能给整个团队造一个持续干活的代理。
演示里有人在频道问移动端最新反馈有哪些,代理秒回长串。
它汇总公开评论与客服工单,还有客户频道的分散讨论。
末尾还列出离线模式等具体请求,每条都带来源与时间。
这不是单轮问答,而是跨工具抓取后的整理与排序。
值得读的原因很直接,团队复用与治理第一次被打包交付。
记忆与定时与审批与跨应用调用,一次补齐不再自造轮子。
本文从真实场景切入,拆开共享运行与合规治理的落地细节。
先看 scout 的工作方式,再看六个模板与三类产品边界。
九月十三日的来源是官方发布与配套演示视频与说明页。
角度是企业落地,重点讲权限与审计与防诱导机制。
如果你管团队知识流,这篇可以直接对照着试用清单落地。
对比老定制助手,新版本把执行与治理一起交付。
这正是企业敢把真实业务接进来的关键变化。
后文会逐个拆开模板与权限与审计的实现方式。
读完可以直接按清单搭建第一个团队代理。
频道里的提问不需要艾特任何人,代理会自动接住。
它在讨论串里回复,不打断主频道的正常交流。
汇总时按优先级排序,高频问题排在最前面。
每条结论都可追溯到原始消息,避免凭空捏造。
演示视频三步走:描述接入测试的完整闭环
第一步在侧边栏找到入口,用一句话说清需求。
例如监控频道反馈并解答疑问,每周整理新问题。
系统会逐项勾选编写指令与画像等准备动作。
左侧显示进度,右侧实时生成代理卡片。
卡片上挂载任务看板与网盘与日历三款工具。
第二步配置工具授权,明确可读与可写的边界。
共享写入需要单独确认,不默认放开全部权限。
频道选择也要明确,测试期只进小范围频道。
第三步运行测试并迭代,直到输出稳定可用。
不满意就改指令再跑,直到符合团队口径。
整个过程不需要写代码,业务同学也能独立完成。
上传文档后系统自动提炼规则,省去大量沟通。
测试通过后再邀请全组使用,风险完全可控。
这套三步闭环,是团队版本易用性的核心。
把搭建成本压到一句话,复用收益放到全组。
演示视频的细节证明,重点不在模型多强。
重点在跨工具执行与持续在场与可治理。
这正是本文反复强调的落地视角。
看懂这三步,就看懂一半的产品逻辑。
剩下的一半是治理与选型,后文继续拆开。
一次构建全组复用:共享运行机制拆解
侧边栏点击Agents后,用自然语言描述团队的日常工作流。
系统会引导你写指令与画像,并逐步接入工具与技能。
不擅长写提示词也没关系,可以直接上传一份说明文档。
系统会自动提炼规则,并生成可测试的代理卡片。
卡片上挂载文档与邮件与聊天记录与代码与业务系统。
一旦构建完成,组内所有人都能在聊天应用里调用它。
也可以把它邀请进频道,像同事一样随时参与讨论。
构建一次全组受益,这是与个人助理最大的不同。
它能在后台持续执行长流程,即使你下班也不停工。
还可以设为定时任务,或常驻频道随时待命响应。
跨工具提取上下文后,还能执行被授权的具体操作。
例如更新任务看板上的事项,或新建文档或发送频道消息。
这种持续在场的能力,让它更像数字同事而非问答框。
团队知识不再散落在个人聊天记录里,而是沉淀为可用代理。
新人入职时直接调用老代理,就能继承成熟的工作流。
测试时先用只读工具,确认输出稳定再放开写入。
画像里写清职责边界,避免代理越权处理敏感事项。
指令要给出输入输出示例,减少理解偏差。
每次迭代只改一处,便于定位问题来源。
共享的本质是把个人经验变成组织资产。
以前靠口口相传,现在靠可调用的代理。
调用记录本身也是沉淀,能看出哪些流程最常用。
高频流程值得继续打磨,低频流程可以先放一放。
不是换皮:长流程能力补齐的五个关键点
老一代定制助手只能做对话式配置,跑不完长流程。
新版本补齐记忆,能记住团队偏好与历史决策。
补齐工具调用,能跨多个业务系统连续作业。
补齐审批环节,敏感操作执行前必须请求确认。
补齐定时能力,每周五自动抓数成图写分析报告。
补齐跨应用上下文,打通文档邮件聊天代码与工单。
官方说法是云端全托管运行,编写代码与调用工具都内置。
底层由代码执行引擎驱动,具备多步骤连续作业能力。
与初代最大的差异在于下班后仍在后台推进任务。
定时与常驻两种形态,覆盖周期汇报与即时问答。
这五个能力合在一起,才构成可交付的团队生产力。
缺少任何一个,企业落地时都要自己补工程与运维。
这次官方一次性打包,试错成本被压到很低。
免费试用到五月初,此后才按点数计费结算。
但具体点数定价尚未公布,采购预算仍有不确定性。
长流程最怕断在中间,新能力重点解决续跑问题。
记忆让跨天任务不用每次从头交代背景。
定时让周期工作自动触发,不再依赖人工提醒。
审批让高风险动作始终有人把关。
跨应用打通后,不用来回复制粘贴搬运信息。
省下的时间可以直接用来判断与决策。
这才是代理对管理者的真实价值。
不是回答更快,而是流转更少断点。
云端引擎在跑代码:开源与托管的分工逻辑
驱动它的执行引擎来自代码助手底座,已经在云端验证很久。
八月开源的编排层收获大量关注,托管版紧随其后到来。
开源争的是开发者心智,托管收的是工作负载的账。
同一时期各家都把重兵压向执行层,逻辑并不复杂。
模型推理能力正在快速商品化,只卖字元很难筑墙。
谁定义代理如何调工具管数据编业务,谁就拿到主动权。
这次托管版最大亮点是两个零,费用与准入都很友好。
平台本身不收附加费,只为消耗的字元与工具付费。
编排层以宽松协议开源,可以先读源码再做决策。
这对要不要交出编排层的团队非常关键。
但托管版的边界也要看清,循环压缩恢复都在官方侧。
模型层只支持自家模型,开源底座可读但托管不等同。
执行层最自由,自有机器或专有云或合作方都能选。
自托管执行不等于数据不出边界,会话仍在官方侧存档。
数据驻留目前仅限美国,且不支持零保留选项。
开源底座的价值在于可读,关键路径都能审计。
托管服务的价值在于省运维,扩缩容都不用操心。
两者不是二选一,而是先读后用的组合。
先读懂循环与压缩逻辑,再决定托管范围。
读源码时重点看工具调度与记忆管理两部分。
这两部分决定代理的天花板与成本结构。
看懂后再谈选型,才不会被演示带偏。
技术决策最怕只看发布会,不看运行账本。
六个官方模板的真实分工:从线索到风控
官方首批给出6个模板,全部来自内部团队真实在用工作流。
scout负责产品反馈路由,从多通道收集并标注排序。
它每周生成一份产品行动计划,直接推给相关负责人。
spark负责销售线索跟进,筛选评估并起草个性化邮件。
它还能同步更新客户关系系统,减少手工录入。
tally是周报机器人,每周五自动抓数成图写分析。
它把枯燥的汇总工作变成定时可预期的交付。
slate负责软件申请审查,对照清单与公司政策自动审批。
它还能创建信息工单,让流程全程留痕可查。
trove负责第三方风控,评估制裁财务与声誉风险。
它自动生成结构化报告,供采购与法务快速决策。
还有一个负责营销策划的代理,补齐创意工作场景。
六个模板覆盖反馈销售汇报审批风控与创意全链路。

团队可以先抄一个模板,再改成自己的工作流。
| 模板 | 输入来源 | 输出交付 | 适合团队 |
|---|---|---|---|
| 反馈路由 | 频道工单公开评论 | 每周行动计划 | 产品与客服 |
| 线索跟进 | 入站线索与评分规则 | 跟进邮件与系统同步 | 销售与市场 |
| 周报机器人 | 业务数据与图表 | 周五分析报告 | 运营与财务 |
| 申请审查 | 软件申请与政策清单 | 审批结果与工单 | 信息与行政 |
| 第三方风控 | 供应商公开信息 | 结构化风险报告 | 采购与法务 |
选模板时先看输入是否齐备,再看输出能否闭环。
输入散落在三个以上系统,共享代理的收益最大。
输出需要每周交付,定时能力的价值最明显。
从一个模板开始验证,比同时铺六个更稳妥。
验证通过后再横向复制到相邻团队。
企业治理的硬细节:审批与审计与防诱导
管理员可以配置代理可用的工具与数据范围。
敏感操作必须先请求批准,才能改表发信加日程。
企业版与教育版还能按用户组做更精细的权限管理。
内置的防诱导机制,能在遭遇外部内容时坚守原始指令。
合规接口提供每个代理的配置与变更与运行记录。
必要时可以一键暂停任何代理,止损动作非常直接。
后续还将增加全组织视角的使用模式与数据源总览。
这套治理组合拳,避免企业自己重复造轮子。
权限与审计与暂停三件套,是进生产环境的门票。
没有它们,代理越能干,风险敞口就越大。
目前仅对4种付费套餐开放,个人套餐暂无缘体验。
覆盖商务版企业版教育版与教师版,边界非常清晰。
官方还明确老定制助手将保留,并支持未来一键转换。
信号很清晰,两条产品线最终很可能会合并。
早期投入较多的团队,现在就要为迁移留好接口。
试运行阶段建议只开查询权限,写入全部走审批。
每个代理都要指定负责人,离职时及时交接。
变更记录要保留,便于回滚到上一个稳定版本。
外部内容一律视为不可信输入,先清洗再使用。
定期复查数据源授权,过期的连接及时下线。
审计的重点不是看热闹,而是看越权与异常。
每周抽查一次高风险操作的批准记录。
发现诱导内容绕过防线,立刻暂停并复盘。
治理做扎实,业务才敢把真流程交出来。
与开发者接口的边界:团队用哪个开发者用哪个
九月十日开放的开发者接口,面向的是自建框架的团队。
它把代码执行底座开放出来,全托管运行云端代理。
费用上没有平台附加费,只收字元与工具的钱。
九月十三日的团队版本,面向的是不懂代码的业务团队。
它住在聊天应用与协作频道里,开箱即用强调共享。
一个重代码与部署,一个重描述与复用,定位完全不同。
差异化在工具数据与工作流的团队,适合用托管接口。
要做多模型跨平台的团队,更适合读开源底座自研。
只想解决周报与反馈与审批的团队,直接用团队版本。
三者的共同结论是模型已不是唯一瓶颈。
表现不好时先查框架层,再决定要不要换更强模型。
同一个模型套不同运行框架,表现可能是两回事。
有实测显示仅做痕迹保留与压缩,基准得分提升近两倍。
输出字元还减少约六倍,成本账完全被改写。
这组数字无法独立复现,但方向与产品动作一致。
选型时先问团队有没有专职开发资源。
没有开发资源就用团队版本,有则评估接口版本。
已有成熟工作流的团队,可以双轨并行验证。
验证期对比漏报误报与人工成本,再做取舍。
不要为追新而迁移,业务闭环才是唯一标准。
接口版本适合把代理嵌入自有产品。
团队版本适合把代理嵌入协作流程。
嵌入位置不同,评估标准完全不同。
前者看延迟与成本与可控性,后者看复用与易用。
落地清单:从一条工作流到第一个团队代理
第一步选一个每周重复且输入分散的工作流。
例如客户反馈汇总,或线索跟进,或周报生成。
第二步准备一份说明文档,写清规则与输入与输出。
把评分标准与审批人与例外情况都写进文档。
第三步在侧边栏用一句话描述需求并上传文档。
让系统生成指令与画像,并完成初步测试迭代。
第四步只接最小必要工具,先跑通再扩大授权。
敏感写入一律要求人工批准,不贪图全自动。
第五步邀请到小范围频道试运行两周。
每周对照行动计划检查漏报与误报。
import json
from collections import Counter
from datetime import datetime, timedelta
def route_feedback(messages, days=7):
cutoff = datetime.now() - timedelta(days=days)
recent = [m for m in messages if m.get("ts") and m["ts"] >= cutoff.isoformat()]
scored = []
for m in recent:
text = m.get("text", "")
score = 0
if "离线" in text:
score += 3
if "崩溃" in text or "失败" in text:
score += 3
if "建议" in text:
score += 1
scored.append({"text": text, "score": score, "ch": m.get("ch", "")})
scored.sort(key=lambda x: x["score"], reverse=True)
hot = Counter([s["ch"] for s in scored]).most_common(3)
plan = {"week": cutoff.date().isoformat(), "top": scored[:10], "hot_ch": hot}
with open("weekly_plan.json", "w", encoding="utf-8") as f:
json.dump(plan, f, ensure_ascii=False, indent=2)
return plan
if __name__ == "__main__":
demo = [
{"text": "移动端希望支持离线模式", "ch": "反馈", "ts": datetime.now().isoformat()},
{"text": "导出时失败了一次", "ch": "工单", "ts": datetime.now().isoformat()},
{"text": "建议优化 weekly 报表图表", "ch": "频道", "ts": datetime.now().isoformat()},
]
print(route_feedback(demo))
第六步接合规接口,把配置变更与运行记录留痕。
离职交接时代理即文档,新人调用即可继承经验。
第七步评估点数消耗,再决定是否扩大到全组。
免费期结束后的计费方式,要提前问清销售。
这套清单跑完,第一个数字同事就能正式上岗。
上线后每周看一次运行记录,持续优化指令。
把高频问题沉淀为示例,代理会越用越稳。
团队的第一个代理不用大,从小闭环开始最好。
跑通一个再复制到更多场景,风险最小。
清单的每一步都要有人负责,避免无人跟进。
负责人每周同步一次进展,及时调整授权范围。
更多推荐



所有评论(0)