LLM评估」共找到 1596 篇相关文章

开源动态8

多智能体编排太繁琐?MASFactory用Vibe Graphing直接「话」出来了

多智能体系统编排当前较为繁琐,北京邮电大学开源 MASFactory 框架,提出以图为中心架构和 Vibe Graphing 开发范式,将开发推向自然语言驱动时代,系统评估显示其效果良好。

PaperAgent
算法论文8

LaPha:你的Agent轨迹其实嵌入在一个Poincaré球?

经典强化学习动作空间离散有限,但语言模型动作空间几乎无限。上海科学智能研究院联合复旦大学提出LaPha,将智能体行为树映射到潜空间,构造密集奖励、剪枝等,在基准测试中效果显著。

机器之心
新闻资讯7

IMO题库“过时”了!OpenAI内部模型挑战最新First Proof,做了7天错了一半

谷歌发布Gemini 3 Deep Think爆火后,OpenAI用未发布内部模型,一周内尝试解答10道来自数学家科研现场的真实问题,5道基本正确。这些题取自真实研究,切断模型“背答案”可能,意味着自主推理能力进化。

量子位
新闻资讯8

谷歌AI连发6篇数学论文!Gemini攻入博士级科研,91.9%刷爆SOTA

谷歌DeepMind放出多篇重磅论文,Gemini Deep Think成「科研合伙人」,攻克多领域难题。谷歌打造基于Gemini的「AI数学家」Aletheia,在博士级难题获科研里程碑,首批6篇论文成果斐然。

新智元
推荐文章8

AI Agent 总翻车?这篇综述戳破了 3 个关键误区

很多团队做AI Agent停留在‘LLM+工具’表面拼接,运行易出问题。该综述指出AI Agent是‘系统’,介绍其架构,还给出常见误区的应对方法、落地检查清单,展望应用前景。

CourseAI
开源动态8

Minion Skills: Claude Skills的开源实现

Claude推出Skills系统,让AI Agent按需处理专业文档。作者在Minion框架中实现开源版本,介绍设计理念、实现细节,包括技能定义、发现、注册表等,还展示效果、亮点,阐述开源原因与未来方向。

量子位
新闻资讯8

马斯克「世界模拟器」首曝,1天蒸馏人类500年驾驶经验!擎天柱同脑进化

特斯拉官宣「世界模拟器」,可模拟、合成自动驾驶的「孪生世界」,生成不同视角和长尾场景。它基于端到端神经网络,有学习人类价值观等优势。还能用海量数据解决难题,输出可解释中间结果,为自动驾驶和擎天柱训练服务。

新智元
开源动态8

教多模态大模型学会“反思”和“复盘”,上交&上海AI Lab重磅发布MM-HELIX&AHPO,破解多模态复杂推理难题

上海交通大学和上海人工智能实验室研究团队带来MM - HELIX,这是完整生态体系,赋予AI长链反思性推理能力。其含基准测试、数据集、优化算法,搭载相关技术的模型表现优异,部分成果已开源。

量子位
推荐文章7

从私域知识到智能 Agent:构建智能运维知识库

抖音算法工程师王宁在 QCon 大会分享,介绍将私域知识与 LLM 融合构建运维系统的方法,详解 SOPAgent 架构解决传统 AIOps 难题,还提及多模态数据处理、知识管理体系等亮点。

InfoQ
新闻资讯7

00后MIT华人女生辍学创业,已融1.5个亿

00后华人女生Jessica Wu从MIT辍学,创立Sola Solutions,定位RPA界Copilot,获2100万美元融资。公司用LLM和计算机视觉构建自动化流程,已应用多行业,收入增长快。

量子位