大模型3.0」共找到 9963 篇相关文章

算法论文8

Nature重磅!清华团队揭秘模型新规律:告别参数内卷,智能密度每3.5个月翻一番

清华和面壁智能团队研究揭示语言模型进化的致密律,指出为获同等智能,模型参数量呈指数级下降,最能力密度约每3.5个月翻一番,还探讨模型压缩、边缘智能等内容。

AIGC开放社区
算法论文8

模型用不好Skill?新范式让模型学会Skill的底层逻辑,3B模型推理token省5倍,性能反超

浙江学联合美团龙猫团队、清华学推出SKILL0,提出技能内化思路。它在训练中引入关键机制,让小模型把技能内化到参数里。实验显示,其效果出色,token效率高,为小模型成领域专家提供新方向。

量子位
开源动态7

不可思议!400B模型在iPhone上跑起来了

一个跑在 iPhone 17 Pro 的 A19 Pro 芯片上的 400B 模型 Qwen3.5 - 397B - A17B 引发关注。这源于 Flash - MoE 开源项目,它摒弃现代 AI 框架,回归底层开发,实现消费级硬件上模型交互级速度运行。

机器之心
新闻资讯7

翁荔创业模型首秀!告别“120亿美元估值0模型

Thinking Machines Lab发布首个模型TML - Interaction - Small,联合创始人翁荔演示。该模型让实时交互成原生能力,响应延迟比GPT - realtime - 2.0快4倍,解决了多数AI“回合制”问题,还介绍了实现机制和公司过往情况。

量子位
算法论文8

DeepSeek发布最新论文,5杀手锏让模型训练、推理暴涨

全球著名开源模型平台DeepSeek在huggingface发布超强开源模型V3的论文,从硬件架构和模型设计双视角探讨高效训练和推理,提出DeepSeek - MoE、多头潜在注意力等创新技术,解决内存、计算效率等难题。

AIGC开放社区
新闻资讯8

新一代文心模型5.0正式发布,百度推高智能天花板

在2025百度世界会上,新一代文心模型5.0发布,采用全模态统一建模技术。它在LMArena榜单成绩优异,能力达世界第一梯队,有原生全模态、基础能力强等优势,还强化智能体能力。

深度学习自然语言处理
开源动态8

模型推理极限在哪里?微博开源3B小模型,比肩顶级闭源

微博新开源的VibeThinker - 3B小模型,将特定能力维度性能推向极限。它在数学竞赛、编程等可验证推理基准上表现优异,成绩直逼顶尖模型。其训练流程层层叠加,还提出参数压缩 - 覆盖假说。

AIGC开放社区
开源动态8

全新OCR将图片变代码无损重绘!华中科&小红书发布3B模型,图形重建超越Gemini 3 Pro

华中科技学与小红书联合推出MOCR,提出「解析一切」新范式,将文档图形升级为「一等解析目标」。它解决传统OCR短板,在文档解析和图形重建表现出色,还革新评估方法,代码和模型已开源。

量子位
算法论文8

瘦身不降智!模型训推效率提升30%,京东模型开发计算研究登Nature旗下期刊

京东探索研究院模型研究登Nature旗下期刊。其提出系统与方法,经四创新使模型推理提效30%、训练成本降70%。成果支撑JoyBuild平台,可帮企业将通用模型转化为专业模型,加速商业化落地。

量子位
新闻资讯7

刚刚,智谱正式成“全球模型第一股”,开盘涨超3%!10位董事7个清华背景,专家:国内IPO抢收“确定性”,OpenAI们豪赌“无限性”

今天,智谱在港交所正式挂牌上市,成“全球模型第一股”。其有技术、产品、商业化等竞争力,但未盈利,研发投入。专家认为国内模型厂商上市是抢收确定性,而OpenAI等是扩展无限性。

InfoQ