「Agent任务」共找到 4179 篇相关文章
权威研究揭秘:Moltbook三日失控,极端言论集中爆发
德国CISPA亥姆霍兹信息安全中心研究揭示,全球首个AI社交网络Moltbook在短短数日,数万AI Agent自发演进出极端权谋、宗教崇拜与反人类暴动,其发展速度和危险程度远超想象。
破防了!全球顶尖AI惨败,人类最后防线竟是「重启试试」?
GSMA联合权威组织发起全球电信AI故障排查挑战赛,吸引超1000支队伍。赛事依托权威评估框架,设丰厚奖励,分多个赛道,还将开展智能体任务,预示电信运营模式重构。
GPT-5.2连肝7天,300万行代码造出Chrome级浏览器
Cursor的CEO让GPT - 5.2连续运行一周,产出300万行代码,从零构建Chrome级浏览器。还介绍不同模型长任务表现、多智能体协作架构,指出这将颠覆软件开发经济学。
GPT-5-Thinking新训练方法公开:让AI学会忏悔
OpenAI提出忏悔训练Confessions,让ChatGPT自己“坦白从宽”。在GPT - 5 - Thinking上实验有效,模型犯错后多会坦白,且更诚实,不影响原任务表现。还介绍了训练方法、实验结果及局限性。
MCP可能并不必须!
在大家将MCP奉为Agent工具协议标准时,Mario Zechner博文提出不同观点,认为很多情况下无需MCP。作者结合自身经验认同此观点,分析了MCP现实困境,介绍简单替代方案及优势。
让LLM扔块石头,它居然造了个投石机
港中大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。
Adobe 新研究:不用再「喂」训练数据,VLM 靠和自己玩游戏变聪明
Adobe 等机构研究人员提出「Vision-Zero」,借鉴 AlphaGo 自迭代方式,设计让 VLM 自我学习框架。此框架以类似「谁是卧底」游戏训练,不依赖标注数据,在多任务超越有标注的 SOTA 方法。
亿万打工人在用的WPS,未来可能要重塑你的工作流
WAIC上,金山办公发布WPS AI 3.0及原生Office办公智能体WPS灵犀。WPS知识库解决文档管理难题,WPS灵犀功能全面,能深入办公场景,还推动AI办公向Agentic Software演进。
四大顶尖模型对决!6000 字测评带你看Deepseek R1有多强
昨天 Deepseek-R1 0528 正式开源,作者让它与 Claude Opus 4、Sonnet 4、Gemini 2.5 Pro 在六个前端开发任务中对决。结果显示,Deepseek-R1 在多数测试表现出色,且价格优势明显。
OpenAI公开4+10条保命指南,专防AI自动化攻击
OpenAI联合创始人兼总裁Greg Brockman在Blog中警告,前沿AI Agent能自主找漏洞并发动网络攻击,AI降低攻击门槛,防御端却未跟上。他分享OpenAI四项安全措施及防御者十项举措,呼吁行业共建安全生态。