大模型数据」共找到 9999 篇相关文章

算法论文7

模型宣称的“百万字处理能力”是真本事,还是营销噱头?LongCodeBench揭露真相

近年来模型号称有百万字处理能力,但这是真本事还是噱头存疑。论文用LongCodeBench测评工具揭开长上下文模型真实表现,测试顶尖模型发现长文本能力‘翻车’,还分析了长上下文难的原因及面临的瓶颈。

深度学习自然语言处理
新闻资讯7

内部爆料:Alexandr Wang上任第一把火,Meta模型闭源

据知情人士,Meta新成立的超级智能实验室正讨论重决策,高层对AI模型是否开源存分歧。Meta曾因性能问题延迟Llama 4版本,现完成Behemoth训练却因不佳延迟发布,还探讨放弃它开发闭源模型

机器之心
开源动态8

DeepSeek-R1发布后的100天复现之旅方法总结

DeepSeek团队发布「推理模型」DeepSeek-R1 ,其技术细节未完全开源,全球研究团队开启“复现竞赛”。论文总结100天复现经验,介绍推理模型与普通模型区别、复现方法、关键发现及未来方向。

深度学习自然语言处理
新闻资讯7

LLM总是把简单任务复杂化,Karpathy无语:有些任务无需那么多思考

随着推理模型和思维链普及,模型有了‘深度思考’能力,但现在有些偏科,简单任务也复杂化。AI牛Andrej Karpathy发长文指出该现象,认为是基准测试优化所致,模型发展不能只追求分数。

机器之心
新闻资讯8

智源发布 2026 十 AI 技术趋势:世界模型成 AGI 共识方向

2026年1月8日,智源研究院发布《2026十AI技术趋势》,指出AI演进核心从语言学习转向理解物理世界秩序。报告阐述了AI从数字迈向物理世界的三条驱动主线,并给出十趋势,为行业提供布局锚点。

AI前线
新闻资讯8

新鲜出炉!斯坦福2025 CS336课程全公开:从零开始搓模型

斯坦福学2025年春季CS336课程“从头开始创造语言模型”课程和材料全公开。介绍了讲师信息,课程目标是引导学生开发语言模型,含5单元19门课,注重实践,还说明了学习该课程需具备的能力。

机器之心
推荐文章8

人工智能研究者如何意外发现:我们对“学习”的理解,可能全是错的

传统理论认为模型会过拟合,而如今模型却驱动了诸多应用。2019年研究者突破传统扩模型规模,出现‘双下降’现象。‘彩票假说’解释其成功原因,还重新定义了‘智能’,揭示科学进步规律。

宝玉AI
推荐文章7

《中国Data&AI数据基础设施白皮书》——AI创生核心生产力,开启万亿新基建之路 | 甲子光年智库

全球正处地缘政治与AI技术变革中,AI跃升为核心生产力。中国企业面临‘挤压式转型’,传统数据系统难满足需求。数据厂商需构建新一代数据基础设施,技术上‘湖仓一体’与‘AI原生’融合,推动Data&AI一体化。

甲子光年
算法论文8

让LLM扔块石头,它居然造了个投石机

港中研究团队带来《Agentic Design of Compositional Machines》,推出BesiegeField平台,支持并行实验和模型‘自我进化’。它将机械设计转为语言生成任务,通过闭环训练提升模型能力,多个模型测试表现良好。

量子位
算法论文8

Learning from peers!让LRM互相「传纸条」的新协作方式幅提高准确率和效率

当前主流模型如QwQ - 32B存在“前缀主导陷阱”,推理开头出错会使准确率暴跌。研究者受“同伴互助”启发提出LeaP框架,设计三种路由策略,实验显示小模型能借此超越模型,开创了多种可能性。

深度学习自然语言处理