「系统级Agent」共找到 4660 篇相关文章
全面战胜ReAct!斯坦福全新智能体推理框架,性能提升112.5%
斯坦福和MIT团队推出新AI智能体推理框架ReCAP,在长上下文任务中全面超越ReAct,性能提升显著。它通过独特结构和三大机制解决大模型常见问题,虽成本增加,但在关键任务表现出色,潜力巨大。
GPT-5得分不到0.4!法律+金融最大规模基准:1.9万+专家评估准则
新推出的PRBench基准可测AI在金融和法律领域表现。它有19356条专家评估准则,是该领域最大公开基准。顶尖大模型在困难子集得分低,还独创经济路径分析维度,约30%任务为多轮对话,揭示了AI在专业领域的不足。
我的AI OS搭建思路
作者黄益贺分享AI OS搭建思路。其系统以Claude Code为框架、Kimi K2 Thinking为模型,通过Skill和自定义命令满足工作需求,设计三层文件夹体系处理信息,供大家参考搭建。
跨层压缩隐藏状态同时加速TTFT和压缩KV cache!
论文 UNCOMP 被 EMNLP 2025 主会接收,提出高效推理框架,用截断矩阵熵解释 LLM 稀疏化,据此设计 UNCOMP 框架,通过压缩隐藏状态优化 KV Cache,实现计算与内存联合优化,实验效果显著。
让LLM扔块石头,它居然造了个投石机
港中大研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和大模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。
卡帕西:强化学习很糟糕,但其他所有方法都更糟
卡帕西在近两小时访谈中解答诸多问题。他认为AGI成熟约需十年,现有的LLM有认知缺陷,强化学习糟糕但其他方法更差,AGI将延续2%GDP增长趋势,还谈及自动驾驶、教育等方面看法。
313页的StateofAI2025报告全解读:今年AI圈发生了什么
本文解读了313页的《State of AI 2025》报告,回顾去年预测,盘点今年AI圈大事,如DeepSeek崛起、OpenAI开源、NVIDIA循环投资等,还提及AI安全、数据使用情况,最后给出2026年10个预测并为普通人提供关注建议。
清华万引教授:万倍加速催化剂设计,AI突破DFT瓶颈!
清华大学王笑楠团队提出催化剂设计新基础模型SurFF,发表于Nature Computational Science。它无需昂贵实验或耗时DFT计算,实现对金属间化合物表面暴露与形貌的高效、高精度预测,计算速度提升10⁵倍。
承认自己开源不行?转型“美国DeepSeek”后,两个谷歌研究员的AI初创公司融到20亿美元,估值暴涨15倍!
AI创业公司Reflection AI由两位前Google DeepMind研究员创立,一年完成20亿美元融资,估值达80亿美元。它从编码智能体起步,现转型为开源替代公司,主打“开源”牌,计划明年推前沿语言模型。
Fluss 湖流一体:Lakehouse 架构实时化演进
湖仓一体 Lakehouse 成主流架构,但数据时效性最多达分钟级。阿里云罗宇侠在 QCon 大会分享 Fluss 湖流一体方案,解析技术架构与原理,介绍融合趋势、核心优势、使用方法及未来规划。