大模型架构」共找到 9813 篇相关文章

开源动态7

从文心开源谈起,论模型发展新生态

6月30日百度宣布开源ERNIE 4.5即文心4.5系列模型,实现预训练权重+推理代码完全开源。文心团队提出创新架构,增强多模态理解能力。今晚7:30,CSDN邀专家深度解读文心开源及行业趋势。

AI科技大本营
开源动态8

小米打通智驾和具身模型,然后开源了

小米汽车陈龙团队开源全球首个跨具身基座模型MiMo - Embodied,基于MiMo - VL架构,采用四阶段训练策略,打破室内操作与户外驾驶领域鸿沟,在29个Benchmark上超现有模型

量子位
新闻资讯7

“龙虾”时代,模型公司的好日子来了

3月10日,MiniMax港股收涨,市值超百度。OpenClaw爆火,其创始人转发评测榜单,使MiniMax-M2.1排名突出。OpenClaw是智能体构建框架,为模型公司带来盈利转机,撬开收入天花板,引发各方关注。

远川科技评论
算法论文8

Anthropic:模型开始意识到自己在想什么!

Anthropic的Jack Lindsey论文《Emergent Introspective Awareness in Large Language Models》对模型做神经科学受控实验。发现Claude Opus 4/4.1能感知内部念头,区分内外状态,通过检查内部状态一致性判断输出意图。

深度学习自然语言处理
算法论文7

幻觉终结者,PoG给模型“打补丁”

传统检索方式易给语言模型带入噪声,知识图谱虽能提供可靠知识,但处理多跳和多实体问题有局限。Paths-over-Graph(PoG)方法通过多跳路径探索、路径剪枝等提高LLMs在复杂任务中的表现,减少幻觉。

CourseAI
推荐文章7

什么!我把SQL编辑器装进了模型

文章介绍基于约束解码技术,结合CFG、Jinja模板和XGrammar框架,为模型SQL生成配备“编辑器”。它能保证语法正确、遵循规则,还具灵活性。但面临约束干扰和性能瓶颈,未来可简化配置惠及更多用户。

阿里云开发者
算法论文8

挤干模型高分「水分」!最强模型仅49分,南傅朝友发布Video-MME-v2

南京学傅朝友团队在 Google Gemini 评测团队邀约下推出视频理解新基准 Video-MME-v2。它有创新的分层能力体系与组级非线性评分,揭示模型与人类的巨鸿沟、传统 Acc 指标虚高、“Thinking”并非总是增益等现象。

机器之心
算法论文8

首篇全新情景认知视角的模型Agent综述

中科的这篇Survey从全新情景认知视角对模型Agent进行综述,给出Agent本质,介绍Agentic AI定义、模型五层演化理论等,还以OpenClaw为例说明,旨在提供理解框架与未来方向。

PaperAgent
开源动态8

The Batch:841 | 语言模型正在纠正历史遗留的不公

美国北加州旧不动产契约含种族歧视条款,人工筛查耗时久。斯坦福和普林斯顿学研究人员微调语言模型实现自动识别,分析圣克拉拉县契约,发现诸多受影响土地,且揭示少数开发者推动住房隔离,模型已开源。

DeeplearningAI
开源动态8

不改模型、不降质量,谷歌让Gemma 4快了3倍:本地跑模型彻底变天

谷歌给Gemma 4家族更新Multi - Token Prediction推测解码架构,推理速度最高提升3倍且输出质量不变。介绍了LLM推理慢的原因、MTP解决办法、对开发者的利好、技术细节、使用方式等。

AI寒武纪