「Agent能力」共找到 5270 篇相关文章
不安全指令,一拒了之?TRIAD用三路决策:修复AI智能体的危险计划
墨尔本大学团队开源TRIAD框架,将传统二元护栏决策扩展为继续、更新、拒绝三类。通过自然语言反馈引导Agent修正计划,在ASB和AgentHarm评测中,显著降低攻击成功率,提升正常任务完成率。
7,700+ star 微软 SkillOpt 可以训练的Skill
微软研究院开源了SkillOpt(7700+ star),把Skill文档当成‘可训练的权重’来优化。它有独特的6阶段流水线、核心验证门控、Protected Regions机制,还有SkillOpt - Sleep预览功能,让Skill文档可系统化训练。
每周产业洞察 |95分钟AI长片登上戛纳,会用AI的传统影视人 ,正在成为“稀缺产业资源”
北京AIGC视听产业创新中心位于朝阳区,由多方参与,采取‘共创、共建、共享’模式。首创郎园负责运营,提供六大服务平台,截至2025年8月汇聚近百家生态合作伙伴。首创郎园不断拓展服务能力边界。
留给人类数学家的悬赏不多了!谷歌DeepMind一口气解决9道埃尔德什问题
AI进军数学界速度惊人,谷歌DeepMind发布由Gemini驱动的AlphaProof Nexus框架,解决9个埃尔德什开放问题,还证明44个猜想、搞定代数几何难题、改进凸优化理论边界,推理成本低且代码开源。
社区供稿丨35B参数科学性能比肩万亿参数模型,『书生』科学大模型Intern-S2-Preview开源
5月15日,上海AI实验室开源新一代大模型预览版Intern - S2 - Preview,参数35B,多领域比肩万亿参数模型。它深化与昇腾算力生态协同,探索‘通专融合’,强化科学及智能体能力,‘算法 - 系统 - 算力’协同提升训推效率。
谷歌Gemini 3.2偷跑上线!2200行代码一镜到底,Claude/GPT坐不住了
发布会未开,谷歌Gemini 3.2 Flash网页端静默上线,编码实力强悍,代码量大幅提升。其核心技术是蒸馏与稀疏化,推理成本大降。Gemini App集成第三方应用,谷歌I/O大会多款产品将曝光,此次发布对谷歌至关重要。
Anthropic 调整 Claude 额度;黄仁勋最后登访华机;GPT-5.6加速来袭;李彦宏提出AI新指标DAA
2026年5月14日AI资讯日报涵盖多领域动态。新闻有Meta田渊栋创业、黄仁勋访华等;产品应用涉及Hermes Agent、百度秒哒3.0等;推荐文章含腾讯程序员构建执行环境等观点。
谷歌首度证实:黑客已开始用AI发动真实网络攻击!
谷歌5月12日报告,犯罪黑客用AI大模型发现零日漏洞并准备攻击,谷歌拦截。还发现PromptSpy恶意软件调用Gemini API自主决策。目前攻击方借助AI加速,美国政府紧急行动但监管有分歧。
大模型能复刻这些系统吗?ProgramBench给出了残酷答案
斯坦福NLP组发布ProgramBench,用200个完整代码库重建任务测试主流大模型,要求模型仅根据可执行文件还原如SQLite等项目完整代码,结果所有模型实际解决率为0%,说明模型更擅模仿代码表面结构。
2050大会「AGI4Science·新生论坛——正在生长的科学地图 」嘉宾阵容全览!
2026年4月25日上午9点,2050大会将举办“AGI4Science·新生论坛”。论坛由王婷召集,以“三幕剧”展现AI4S从理论到产业的前沿图景。涵盖多领域,17位专家探讨AI4S生长变革,涉及聚变商用、芯片设计等议题。