探索熵机制」共找到 1554 篇相关文章

新闻资讯8

凯捷研究院最新报告:到2028年,Agentic AI市场规模4500亿美元

凯捷研究院报告显示,到2028年Agentic AI有望撬动4500亿美元经济价值,但目前仅2%企业规模化应用。其能自主执行任务,带来商业价值,不过面临信任危机,各行业巨头已开始探索落地场景。

AIGC开放社区
产品应用8

蚂蚁集团扩散大语言模型新突破:超800Token/s,速度与质量兼得

蚂蚁集团将LLaDA更新到2.1,通过引入“草稿 - 编辑”机制,打破扩散模型推理速度与质量的对立僵局。它有极速和质量两种模式,还采用混合训练流程及强化学习,在多基准测试中表现出色。

AIGC开放社区
开源动态8

智能必须基于世界模型?我们和蚂蚁灵波团队聊了聊

上周图灵奖得主 Yann LeCun 认为真正的智能应能在脑海推演,而大语言模型难以触及真实世界。2026 年初,蚂蚁灵波连续四天开源四款具身智能模型,探索从物理交互构建智能的新路径。

机器之心
开源动态8

Mamba 架构实现推理性能超 Gemma3-27B!推理模型开始迈入「无注意力」时代

PromptCoT - Mamba是首个具解码显存常量等特性且推理能力强的模型。当前推理大模型中注意力机制有局限,PromptCoT - Mamba实现无注意力推理,在多评测集超Transformer等模型,为无注意力推理生态奠基。

AI科技评论
算法论文8

瘦身不降智!大模型训推效率提升30%,京东大模型开发计算研究登Nature旗下期刊

京东探索研究院大模型研究登Nature旗下期刊。其提出系统与方法,经四大创新使大模型推理提效30%、训练成本降70%。成果支撑JoyBuild平台,可帮企业将通用模型转化为专业模型,加速商业化落地。

量子位
算法论文7

姚顺雨署名:大模型「现学现卖」能力首次被系统评估,腾讯、复旦联手发布CL-Bench

腾讯混元团队和复旦大学研究人员联手推出全新基准测试CL - Bench,系统性评估大模型上下文学习能力。测试显示十大前沿模型表现不佳,揭示当前大模型在该能力上的普遍短板,并指出未来四个探索方向。

AI寒武纪
产品应用8

美团提出全新多模态统一大模型STAR,GenEval突破0.91,破解“理解-生成”零和困局

近日美团推出多模态统一大模型 STAR,以“堆叠自回归架构 + 任务递进训练”实现理解与生成双重突破。它解决行业痛点,通过三大核心设计统一能力,实验在多任务中表现顶尖,还给出后续探索方向。

机器之心
算法论文8

LightMem用3招重新设计了LLM的记忆,结果出乎意料

LLM在超长多轮对话中有上下文窗口有限、记忆系统昂贵的痛点。LightMem借鉴人类记忆机制,用三招重新设计LLM记忆,实验显示其准确率超基线,还降低token使用量、API调用和运行时间。

PaperAgent
产品应用8

Jina Reranker v3: 全新“列式”重排器,0.6B参数刷新文档检索SOTA

Jina AI推出第三代重排器Jina Reranker v3,在多语言检索基准上刷新SOTA。它参数仅6亿,有“last but not late”交互机制,能一次性处理查询和文档。还提供动态量化格式,方便不同硬件部署。

Jina AI
产品应用8

一文读懂DeepSeek-V3.2核心技术DSA:API疯狂降价性能不减的背后

DeepSeek发布实验模型DeepSeek V3.2,引入自研稀疏注意力机制DSA,API价格最高降75%。DSA先筛选后计算,含闪电索引器和稀疏多潜在注意力两组件,分四步工作,权衡了精确性与速度。

AI寒武纪