「大模型3.0」共找到 10059 篇相关文章
SceneSplat: 基于3DGS的场景理解和视觉语言预训练,让3D高斯「听懂人话」的一跃
文章引入 SceneSplat,首个在 3DGS 上原生运行的端到端大规模 3D 室内场景理解方法,提出自监督学习方案,构建发布 SceneSplat - 7K 数据集,在多个实验中达 SOTA 效果。
华为具身大脑一号位创业,用认知科学造世界模型,获亿元级融资
2026年世界模型成AI热门,资本人才汇聚让AI理解物理世界。具脑磐石获亿元融资,由曾任华为云AI算法创新Lab主任的朱森华创立,用认知神经科学重做机器人脑模型,构建认知世界模型。
轻量级语音模型Vui开源,支持本地部署,笑声停顿全拟真,4万小时练出人类对话感!
近日,Fluxions - AI团队在GitHub开源轻量级语音模型Vui,可设备端运行。它能精准模拟语气词、笑声等,有三款模型,适用于语音助手、播客生成等场景,解决了传统模型的痛点。
线性注意力回归!Kimi新模型引爆,MiniMax却悄悄换回传统架构
LLM领域线性注意力机制正在回归,工程实践主要由国产模型推进。早期线性注意力因牺牲精度未获主流认可,今年下半年多个国产模型采用其变体,MiniMax却又换回传统架构,Kimi新模型带来新解法。
开源模型首次物理奥赛IPhO夺金!上海AI Lab 235B模型击败GPT-5和Grok-4
上海AI Lab的P1 - 235B - A22B在国际物理奥林匹克竞赛夺金,在HiPhO基准测试获12金1银,超越GPT - 5等闭源模型。团队构建HiPhO基准测试,用多阶段强化学习训练模型,开发PhysicsMinions系统提升推理能力。
现有AI都是假实时!Thinking Machines发布交互模型,离真正的贾维斯真的近了
Thinking Machines发布交互模型,切入与AI交互方式问题。该模型能原生支持实时交互,由交互和后台模型组成。架构设计独特,解锁多项功能,评测表现佳,但也存在长会话、计算部署等局限。
深度长文解读 “世界模型” :在虚构与真实交接之处凝视未来
本文深入解读“世界模型”,虽无明确定义,但从目的出发分为表征和生成两类。前者含生物大脑、视觉和语言中心预测;后者有基于规则模拟和数据驱动生成。还探讨LLM是否为世界模型,指出各类模型相辅相成。
DeepSeek-V3-0526 闪现后秒删!
Unsloth文档页面惊现DeepSeek新模型DeepSeek-V3-0526后秒删。该模型性能佳,团队还准备了技术描述。Daniel Han预测其可能端午节前发布,社区对此反应热烈,大家期待DeepSeek下一步动作。
陶大程技术博客首发:从像素复刻到行动控制,具身世界模型的底层逻辑探索|甲子光年
今年世界模型成AI热点,通用世界模型追求像素逼真,具身世界模型不同,其使命是支撑行动。文章拆解具身世界模型底层逻辑,分享开悟世界模型的技术设计与实践思考。
深度讨论新一轮模型发布:当智能进入月更时代 | Best Ideas
近期全球模型迎来高密度发布期,Anthropic、OpenAI、腾讯、DeepSeek 等纷纷推出新模型。文章复盘了 Opus 4.7、GPT - 5.5、DeepSeek V4 等模型实测体验,探讨架构变化、能力边界与产业影响,还分析算力、token 价格等问题。