「办公任务模式」共找到 2860 篇相关文章
GPT-5.1 突然发布,用户实测:更像 4o,情商大幅提升
OpenAI 向部分付费用户推送 GPT - 5.1,有即时思考和深度思考两种模式,系统自动匹配。它有八种人格预设,改进不仅在语气,还提升记忆编织等能力,像是补救 GPT - 5 失败,还扩展安全评估。
腾讯开源了一个通用智能体,又刷榜了GAIA~
腾讯优图实验室开源了 `Youtu-agent`,在深度搜索和工具使用benchmark上表现佳。它不依赖GPT/Claude,有自动智能体生成功能,提供单、多智能体模式,还集成分析平台,可实时调试与离线分析。
重磅!OpenAI深夜发布ChatGPT Agent:AI打工人正式上线「附发布会全程视频」
OpenAI推出ChatGPT Agent,它整合Operator远程浏览器和Deep Research能力,Pro、Plus和Team用户可激活。能完成复杂任务,有强大工具集,性能在多基准测试超人类,但OpenAI因能力增强启动最高安全保障。
让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni
openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页和视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式和适用任务。
ICLR 2026 Oral | 让大模型学会“像法医般思考”,实现可解释、可泛化的深度伪造检测
生成式AI发展使深度伪造技术安全隐患受关注,现有检测器表现不佳。中科院自动化所联合蚂蚁集团提出Veritas框架,构建HydraFake数据集,赋予大模型“模式感知推理”能力,实验效果超现有检测器,还给出未来研究方向。
白嫖微软开源Web Agent,独立开发者的第二双手:自动刷网页、跑脚本、盯进度,全交给 Magentic-UI
Magentic-UI是微软开源的Web Agent界面,能控制浏览器、执行代码等,解决长流程、重复且让人不放心全交给AI的任务。它可视化操作,有可复用计划图库等亮点,使用体验好,适合特定开发者。
The Batch: 964 | Claude 亮相另一款 Opus
Anthropic发布Claude Opus 5,这是款视觉 - 语言模型,运行成本低,多任务表现优于Claude Fable 5。它在多项测试中领先,解决了Fable 5的一些问题,但也有易产生幻觉等不足。
Claude 刚刚上线 “群聊Agent”:Karpathy盛赞的交互新范式,还是打工人的“数字监工”?
当地时间6月23日,Anthropic上线Claude Tag,可接入Slack用于多人协同办公。前OpenAI大神Karpathy盛赞其为交互新范式。不过它也引发隐私担忧,且对“套壳产品”不利,或利好开源模型。
谷歌发布 Firebase Studio 重大更新,用于代理式 AI 开发
7月初谷歌伦敦云峰会上,Firebase Studio展示重要新功能,包括自主代理模式、对MCP原生支持及Gemini CLI集成,旨在简化代理式AI开发,让其更自主、信息丰富且融入开发流程。
通义实验室大火的 WebAgent 续作:全开源模型方案超过GPT4.1 , 收获开源SOTA
WebAgent续作《WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization》提出对information-seeking任务形式化建模,设计训练数据合成方法,全开源模型方案在GAIA评测获SOTA表现,还补足了训练数据不足问题。