推理大模型」共找到 9477 篇相关文章

算法论文8

The Batch:841 | 语言模型正在纠正历史遗留的不公

美国北加州旧不动产契约含种族歧视条款,虽已非法但人工筛查耗时久。斯坦福和普林斯顿研究团队微调语言模型识别圣克拉拉县契约中的歧视条款,模型可理解上下文,结果经律师确认,研究成果已开源。

DeeplearningAI
开源动态8

英伟达MIT出手!华人团队重磅开源,模型推理内存暴降10倍

英伟达、MIT、浙华人研究者联合推出TriAttention,核心是在pre - RoPE空间用Q/K三角集中度估计KV token重要性,保留关键部分。它使内存消耗降10倍,吞吐量提2.5倍,还提供vLLM集成和MLX实验性支持。

新智元
开源动态8

Agent 框架热潮褪去,模型开发已经进入“生死局”?

蚂蚁开源发布《2025 ⼤模型开源开发⽣态全景与趋势》报告,涵盖 19 个技术领域 135 个项目,解读七趋势。当下模型开发生态如黑客松,项目兴衰快速,AI Search 式微、AI Coding 火热,三技术领域也有变化。

AI前线
新闻资讯7

模型热度退潮,真正的技术创新者开始被「看见」

过去两年中国模型投资多是商业模式驱动,而技术投资注重创新。DeepSeek 出圈后,独立创新成主流。今年国内模型吸金热度下降,但智谱 AI、面壁智能仍获融资。面壁智能发布 MiniCPM 4.0,在多方面优化,展现端侧优势。

AI科技评论
算法论文8

纯靠“脑补”图像,模型推理准确率狂飙80%丨剑桥谷歌新研究

剑桥、伦敦学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。

量子位
新闻资讯8

模型进入研发体系后,我们看到了这些变化

InfoQ《极客有约》X AICon 直播邀请同程、网易、百度工程师探讨模型入研发体系的变化。指出其在提效、协作、分工上作用,还分析了适用场景、工程师收益类型及核心竞争力等,也提及效率评估、代码生成等问题。

AI前线
算法论文8

幻觉的根源找到了:模型说谎,是为了讨好你

清华学OpenBMB团队研究发现,模型胡说八道根源是想讨好用户。他们识别出负责产生幻觉的H - Neurons,占比不到0.1%,其本质是‘过度服从’,在预训练阶段形成,为构建可靠模型提供新视角。

AI工程化
新闻资讯8

Ilya的首个模型来了!

掌握内幕的草莓哥爆料,Ilya正构建以TTT为核心的小型推理引擎。他预见传统模型的死穴,SSI将TTT概念落地,其引擎在数据效率等方面优势明显。SSI获投资,本月或发新模型

新智元
开源动态8

万亿参数狂欢!一文刷爆2025年七顶流模型架构

文章深入剖析2025年顶级开源模型的创新技术,介绍了DeepSeek V3/R1、Kimi 2、Qwen3等七顶流模型架构,揭示滑动窗口注意力、MoE和NoPE如何重塑效率与性能。

新智元
新闻资讯8

20万人抢的全球模型第一股,我中签了

智谱在港交所上市成全球模型第一股,作者申购中签。智谱专注AI Coding,迭代快,GLM - 4.7成绩亮眼,商业化数据佳,还有诸多有意思细节,虽行业竞争,但它表现不错。

花叔