淘宝直播数字人以「配置感知」训练适应工具变化

01淘宝直播数字人代理采用「配置感知」训练,团队称线上测试提升GMV与商品页浏览

淘宝直播团队公布了数字人代理的训练和部署方案。数字人主播需要实时回答商品问题、互动并执行营销策略,但其技能、提示、工具和钩子函数会频繁更新。大模型能零样本适应变化,却响应较慢;低延迟小模型若只在固定运行框架上训练,则容易记住技能名称、工具模式和提示模板,配置一变就可能失效。

团队提出Harness-Aware Training,以不改变任务本身的方式,调整技能标识和内容、工具模式、提示结构及钩子函数。训练分三步:先用强模型生成的轨迹做监督微调,学习推理和工具调用;再以通用在策略蒸馏恢复微调损失的泛化能力;最后在增强后的不同配置环境中进行强化学习,提高适应变化的稳定性。

论文报告称,该方法在Live-Stream QA和Harness-Variant QA上分别取得94.8分和94.6分。固定Harness监督微调会令IFEval较基础模型下降7.7分,而配置感知训练避免了这项退化,达到83.5分。

优化后的系统在单张NVIDIA H20上,P50和P95延迟分别为3.4秒和8.1秒。团队称系统已部署到淘宝直播数字人服务,并在GMV和商品详情页浏览量的线上A/B测试中得到正向结果,但未披露样本规模、测试时长及具体增幅。

淘宝直播可在更新营销策略和工具时减少重新适配小模型的风险数字人服务同时面对准确率与实时响应成本线上业务效果仍需等待完整A/B测试数据验证。
来源
Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

02OpenExecutive开源虚拟高管系统:八个专业代理共享企业资料、决策记忆与任务日程

开源项目OpenExecutive把战略、财务、人力、法律、运营、营销、产品和董事会沟通八类专业代理整合为企业顾问。用户只会看到统一的「高管」声音,内部代理分工不会直接暴露;Claude Sonnet 4.6编排器负责并行调用专家并综合答案。

每个代理会从ChromaDB检索项目内置商业资料和企业上传文档,再把相关内容注入当前用户轮次。每次回答后,后台Claude Haiku 4.5流程还会提取关键决策、行动和建议,写入SQLite,并在后续会话通过past_decisions区块恢复。

项目包含FastAPI后端、Next.js 15界面及多种通信集成。首次本地启动需要Python 3.11、Node 22、Anthropic API密钥,并下载约90MB嵌入模型。调度器虽以UPDATE … RETURNING避免任务重复执行,但API目前必须保持单实例,横向扩展前需另行为调度器加控制。项目尚无独立准确性评估或企业采用规模数据。

企业可自行检查并部署代理架构,但上传资料和历史决策会进入本地数据组件开发者需承担模型调用、依赖安装与单实例运行约束下一步要看独立评测和真实企业使用结果。
来源
OpenExecutive项目仓库

03PAWBench测试11个视频生成系统:没有模型能稳定复现物理行为的概率分布

一次生成出符合直觉的视频,不等于模型理解同一条件下可能发生的不同结果。PAWBench研究关注「概率对齐」:面对相同初始观察和动作,世界模型不仅要给出一条合理轨迹,还应复现各种有效物理行为及其出现概率。传统评估通常只看单条视频是否可信,可能漏掉这一能力。

研究团队把视频生成器视为世界动态的随机采样器,推出PAWBench,并用PAWEval对同一场景反复生成,再按结果对应的物理行为归类,形成经验概率分布,与参考分布比较。测试覆盖50种场景和11个当前系统。

论文称,没有一个系统能在覆盖有效行为范围的同时,持续匹配参考概率。团队还测试了语言提示、初始噪声采样和模型训练能否改变预测分布,但摘要未披露各系统名称、分项成绩及三种方法的改善幅度。

世界模型评估需从检查单条成片扩展到重复采样与分布比较开发者需同时提高有效结果覆盖率和概率匹配度三种干预方法的实际改善幅度仍待明确。
来源
PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
04

Amazon追加采购200万颗Nvidia GPU Amazon与Nvidia扩大合作,将在2027至2028年向AWS数据中心新增200万颗Blackwell Ultra、Rubin和Rubin Ultra GPU;双方未披露交易金额。AWS还将接入Nvidia的开放模型、机器人平台和数据处理软件。来源

05

美国法院裁定五角大楼封禁Anthropic违法 加州联邦地区法院法官Rita F. Lin裁定,将Anthropic列为供应链风险属于违反第一修正案的非法报复,相关决定武断且缺乏依据。争议源于Anthropic拒绝允许其AI用于大规模监控美国人和无人监督的致命自主武器。来源

06

OpenAI将在印度ChatGPT免费版和Go版投放广告 OpenAI将首先为50个品牌展示广告,并与WPP、Omnicom两家广告集团合作;其广告管理工具计划下月上线,广告主每日最低预算为725印度卢比。公司称印度每周活跃ChatGPT用户已超过1亿。来源

07

美国环保署拟取消部分数据中心排放许可的联邦公众参与要求 美国环保署提出修改New Source Review许可流程,取消部分“较小”污染源必须发布公告并接受公众评论的联邦要求,改由州和地方机构决定。提案的意见征集已经结束,环保署正在审查超过4900份反馈。来源

08

AI云服务商Lambda举债10亿美元采购Nvidia芯片 Lambda获得10亿美元短期私人债务融资,用于购买将出租给Microsoft的Nvidia AI芯片。该公司此前还完成10亿美元担保信贷安排及9.26亿美元贷款,目前据报正洽谈30亿美元上市前融资。来源

09

生活助理agent Instinct估值升至25亿美元 Instinct完成2.5亿美元B轮融资,累计融资达到3.5亿美元,由Index Ventures和Benchmark共同领投。这款可连接应用与设备、通过短信和电话交互的生活助理agent仍处于私测阶段,其权限要求和使用条款已引发部分用户的隐私担忧。来源

10

OpenAI任命Meta前高管负责东南亚和澳大利亚业务 Meta印度及东南亚副总裁Sandhya Devanathan将加入OpenAI,负责东南亚和澳大利亚的消费者增长、企业采用、合作、监管沟通及运营。她将常驻新加坡,向OpenAI亚太区董事总经理Kiran Mani汇报。来源

11

Google任命Barret Zoph为研究副总裁 Thinking Machines联合创始人、OpenAI前员工Barret Zoph已加入Google,担任研究副总裁。Google称,他将把强化学习和后训练经验用于Gemini;这是Zoph离开OpenAI两个月后确认的新职位。来源

12

Anthropic实验让自动化研究系统改进十项对齐指标 Anthropic论文称,其自动化对齐研究系统能够检索文献、提出方法并训练模型,在十项不当行为基准上均提升表现,同时未降低总体性能。研究者同时指出,结果依赖基准能否准确代表真实对齐目标,基准的建立和维护仍需人工投入。来源

13

OpenAI与泰国政府部门启动八周AI创业加速计划 OpenAI与泰国高等教育、科学、研究与创新部启动加速计划,帮助10家健康、福祉和教育领域初创企业把AI原型转化为产品。项目周期为八周。来源