LLM评估」共找到 1596 篇相关文章

算法论文7

大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱

CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。

量子位
新闻资讯8

Karpathy 亲手终结了 RAG 的草莽时代

Andrej Karpathy分享“LLM Wiki”工作流,不依赖复杂RAG架构,用LLM构建可演化知识库。该方法引发关注,有人认为它“杀死了”RAG,技术社区和企业反响热烈,预示新的产品方向。

AI前线
开源动态8

Anthropic祭出大模型“读脑”杀手锏:LLM决策过程全给你扒开看

Anthropic宣布开源电路追踪工具,可追踪LLM神经元,通过生成“归因图谱”揭示模型输出原因。开源了生成图谱的库和交互式前端,并提供demo notebook。可追踪电路、可视化图谱、检验假设。

AI寒武纪
算法论文8

LLM 竟然会内省!Anthropic 整了个大活:首次揭开 AI 意识

Anthropic最新研究《大语言模型中涌现的内省意识》,首次通过直接操控模型内部状态验证AI能否觉察自己思想。研究采用概念注入技术,发现AI有内省能力,且不同模型表现有差异。

PaperAgent
算法论文8

ACL 2025 Oral | 你的模型评测搭子上线:Evaluation Agent懂你更懂AI

上海人工智能实验室与新加坡南洋理工大学合作研发 Evaluation Agent,它能按需评估视觉生成模型,有可定制、高效率等优势。框架分提案和执行两阶段,评估结果佳,未来将拓展功能。

机器之心
新闻资讯7

英伟达推出通用深度研究系统,可接入任何LLM,支持个人定制

英伟达推出通用深度研究(UDR)系统,支持个人定制,可接入任何大语言模型。它能解决现有深度研究智能体的局限性,有诸多创新特性,但目前还在原型阶段,存在一定局限性。

量子位
产品应用8

告别JSON冗余:TOON让Token成本降低30-60%

LLM交互用JSON有冗余,成本高、速度慢。TOON格式专为LLM优化,结合YAML和CSV特点,比JSON减少30 - 60%的token消耗,还介绍了特性、上手方法、集成实践和适用场景。

CourseAI
算法论文7

生成式推理再排序,可能会是LLM4RecSys的新突破口吗?

Meta AI研究者尝试把推理模型引入推荐系统再排序阶段。论文通过监督微调等赋予模型推理能力,超LLM4Recsys标杆。中期内化物品语意ID,生成推理路径,推理赋能再排序,披露重排序提升空间。

机器之心
产品应用8

告别卡脖子,华为黑科技破局!昇腾推理加速1.6倍打破LLM降智魔咒

大模型参数规模大,推理部署难。华为诺亚提出Pangu Light框架,结合算法创新与国产昇腾平台,通过跨层注意力剪枝等技术,解决剪枝后模型失稳问题,实现高压缩率、推理加速与高精度。

新智元
新闻资讯7

基于百万亿 Token 的 AI 使用模式分析:趋势、拐点与未来|PPT分享

近期OpenRouter报告《人工智能现状:基于OpenRouter的100万亿Token实证研究》,分析超100万亿个token的真实世界LLM交互数据,弥补LLM实际使用情况证据不足,揭示2024年转折及多方面发现。

AI大模型应用实践