「论文新颖性评估」共找到 1642 篇相关文章
LLM本质上永远无法实现真正的正确推理
日本埼玉大学荣誉教授Jingde Cheng论文指出,以ChatGPT为代表的大语言模型(LLM)本质上无法实现真正的正确推理。论文定义了“正确推理”,从逻辑和计算原理论证其局限性,为推理智能体研究指明方向。
全球首个科研LLM竞技场上线!23款顶尖模型火拼:o3夺冠,DeepSeek第四
Ai2耶鲁NYU联合推出科研版「Chatbot Arena」——SciArena,23款顶尖大模型比拼科研任务,OpenAI o3夺冠,DeepSeek第四。该平台解决通用基准测试在科研场景‘失效’问题,但其自动评估系统猜科研人偏好远未及格。
一篇400+文献最新RAG技术系统性综述
本文对RAG技术进行系统性综述,通过筛选5大数据库、128篇高被引文献、343个数据集,给出技术地图、评估框架与未来路线,梳理技术全景、评估指标,还介绍主流数据集,指出RAG已演变为复杂系统。
阿里:RL强化LLM推理,是技巧还是陷阱?
近年来,强化学习(RL)成为解锁大型语言模型(LLM)复杂推理能力的关键工具,但该领域也面临技术选择困境。阿里联合多所高校的论文通过大规模可复现实验,揭示主流RL技巧的机制与适用场景,还发现极简组合(Lite PPO)性能超越复杂方案。
ICML 2026现场最全索引:从快手到大厂,中国企业集体出征
ICML 2026 于7月6 - 11日在韩国首尔召开,投稿量翻倍,录用率26.6%。中国企业全面出击,快手、阿里千问等入选多篇论文,现场活动丰富。中国机构研究呈现从发论文到做现场、单点到系统布局、聚焦效率等趋势。
重写手机AI安全边界!首个MoAI攻防SoK,系统梳理三大安全支柱
墨尔本大学等联合发布论文指出,移动端AI硬件和模型发展使MoAI成重要范式,但带来安全风险。论文给出统一框架,拆解系统为四层,定义三大安全支柱,梳理攻击、防御图谱等,还提出开放问题与未来方向。
颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5
十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。
一夜200万阅读,OpenAI神同步!这项测评框架让全球顶尖LLM全翻车
中国团队领衔全球24所高校机构发布评测LLMs for Science能力的论文,一夜阅读近200万,同一时间OpenAI也发文指出现有评测标准在AI for Science领域失灵。论文推出评测体系SDE,发现主流大模型在科学发现上短板明显。
刚刚,GPT-5 Pro自证全新数学定理!OpenAI总裁直呼颠覆,大佬们集体转发
微软前AI副总裁Sebastien Bubeck让GPT - 5 Pro求解论文中未解数学区间,模型将已知下限从1/L推进到1.5/L,虽论文作者后续超了AI,但此发现仍令人鼓舞,大佬认为AI或改变数学领域。
停止迷信“超级Prompt”:要想AI不犯错,你得专门雇人“怼”它
这篇来自Isotopes AI的论文指出,在生成式AI落地中,迷信‘超级Prompt’不可取。对于高风险场景,单体LLM有局限,论文构建‘AI Office’架构,引入‘对手团队’概念,实验使准确率从60%提升到92.1%,但也有成本和局限。