实验研究」共找到 2868 篇相关文章

算法论文8

拿着做数学题的 PRM 来评判 Agent 调用工具,基本是行不通的!

目前评估体系多为结果导向,在工具调用上缺乏像样的PRM基准。Arizona State University和Intuit AI Research研究者推出ToolPRMBench,指出用做数学题的PRM评判Agent调用工具行不通,还介绍了其构建方法、训练范式和实验结果。

深度学习自然语言处理
新闻资讯7

英伟达2026奖学金,8位华人博士统治榜单!人均6万美金

2026 - 2027年度英伟达研究生奖学金名单揭晓,10位获奖者中华人学者占8席。该奖学金提供最高6万美金科研经费与暑期实习机会。研究方向涵盖神经渲染、AI安全等,体现英伟达关注具身智能和AI安全。

新智元
开源动态8

一个能思考、会记忆的AI导演诞生了!新加坡管理大学,香港中文大学等实现故事化视频生成

新加坡管理大学等提出开源全能多智能体框架UniVA,可统一视频理解、分割等能力,按指令生成完整故事视频。还引入UniVA - Bench基准测试套件,实验显示其在多任务中表现出色,代表视频智能生成重要进步。

AIGC开放社区
算法论文8

字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限

强化学习虽提升大语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在多数学推理基准实验中显著优于强基线,为大模型强化学习提供新范式。

量子位
算法论文8

超越人类标注,Meta提出CoT-Self-Instruct:如何用"推理式自进化"重塑LLM训练

大语言模型发展需海量高质量训练数据,传统人工标注困境重重,现有合成数据方法也有缺陷。Meta提出CoT - Self - Instruct,通过推理式自进化生成数据,实验证明其在多个任务上超越人类标注数据。

深度学习自然语言处理
产品应用8

一夜暴涨至2100亿!开源新王MiniMax M2.5,革了Opus 4.6的命

新智元报道,国产AI春节档,MiniMax M2.5昨夜登场,今日市值涨至2108亿港元。其编码性能逼平Claude Opus 4.6,价格仅为1/20,适配开发者工具,在办公、深度研究等场景表现出色,基于Agent RL技术体系。

新智元
算法论文7

减少检索增强生成(RAG)语义缓存中的误报:以银行业为例

文章围绕检索增强生成(RAG)语义缓存展开,指出其虽能提升效率,但设计不当会产生假阳性。以金融服务FAQ系统为例,经多组实验,发现缓存设计比模型优化更能减少假阳性,还给出未来架构路线图。

InfoQ
新闻资讯7

AI幻觉成WAIC首个关键词,Hinton敲响警钟,讯飞星火X1升级展示治理新突破

今年WAIC上,‘幻觉’成热议词。诺奖得主Hinton、郑南宁院士等指出AI幻觉问题制约其可靠性与实用性。OpenAI等联手研究CoT监测保障安全。讯飞星火X1升级版在幻觉治理等方面取得进步,为可信AI提供佐证。

量子位
算法论文8

大模型能力,小模型成本!Google等 | 提出递归混合框架:MoR, 大幅提升LLM计算效率

Google提出递归混合框架(MoR),融合参数共享与自适应计算。它有轻量级路由和KV缓存策略,在不同路由机制各有优劣。实验显示,MoR在性能、计算和内存效率上表现出色,有望实现“大模型能力,小模型成本”。

AINLPer
新闻资讯7

图灵奖大佬向97年小孩哥汇报?小扎1亿年薪买新贵,老将痛诉熬夜捡GPU!

新智元报道,小扎砸143亿拿下Scale AI 49%股权引入Alexandr Wang任Meta首席AI官,甚至可能让LeCun向其汇报。而Meta老员工因GPU受限研究受阻,科技圈有人上亿年薪,有人被裁,AI圈呈职业体育趋势。

新智元