「训练推理效率」共找到 4386 篇相关文章
IMO题库“过时”了!OpenAI内部模型挑战最新First Proof,做了7天错了一半
谷歌发布Gemini 3 Deep Think爆火后,OpenAI用未发布内部模型,一周内尝试解答10道来自数学家科研现场的真实问题,5道基本正确。这些题取自真实研究,切断模型“背答案”可能,意味着自主推理能力进化。
整整21个月,豆包大模型正式进入2.0时代!
时隔21个月,豆包大模型2.0正式推出。它在多模态理解、企业级Agent、推理和代码能力上有提升,在多个基准测评中达业界最优。实测显示其在编程、数学问题处理上性能出色,性价比也具优势。
视听分离SOTA提速6倍!清华发布首个6M高性能模型|ICLR'26
清华大学团队推出Dolphin模型,仅用6M参数,通过离散化视觉编码和热扩散注意力机制,实现单次推理精准分离语音,速度提升6倍以上,在多项基准测试中刷新纪录,为端侧设备部署开辟新路。
阿里达摩院开源具身大脑基模:3B激活参数性能超越72B,转身就忘事的机器人有救了
阿里达摩院开源RynnBrain具身大脑基础模型,全系列7个。它是业界首个有 时空记忆的模型,在20项具身Benchmark上超顶尖模型。具小而美优势,训练用自研架构提效,数据丰富,输入输出灵活。
大道至简,何恺明团队新作pMF开启像素级「无潜、单步」生成范式
何恺明团队新论文提出用于单步、无潜空间图像生成的pMF框架,直指主流扩散与流匹配模型通病。该框架将v、u和x三个场关联,训练网络把噪声输入直接映射为图像像素,实验表现强劲。
刚刚,梁文锋署名开源「记忆」模块,DeepSeek V4更细节了
十几个小时前,DeepSeek 发布新论文,与北大合作,作者有梁文锋。针对大模型问题提出条件记忆,用 Engram 模块实现,已开源。结合此前研究,DeepSeek v4 模样渐清。模型性能、效率表现优,并发现 U 型扩展规律。
抨击AI炒作、曝企业需求为先,Anthropic 联创:模型提 0.01 性能就血赚,算力烧钱但值!
Anthropic由7位前OpenAI核心成员创立,联合创始人兼总裁Daniela Amodei接受采访,谈到成本控制、AI安全及上市可能。她认为AI安全是核心优势,公司谨慎对待支出和算法效率,虽算力投入大,但硬件回报高。
Groq被收购,失去梦想的员工,人均拿到英伟达的500万美元
2025年末,英伟达以200亿美元对价、“资产收购 + 人才招募”方式将AI推理芯片对手Groq收入麾下,避免反垄断。交易溢价近3倍,款项分阶段支付,员工获丰厚补偿,此模式成硅谷AI生态“新常态”。
模力工场 025 周 AI 应用榜:传统SEO黄昏?蓝莺 GrowAI 说让品牌出现在 AI 答案里!
模力工场第 025 周 AI 应用榜揭晓,8 款应用上榜,涵盖营销、效率、设计等多领域。蓝莺 GrowAI 成榜首,其开发者分享构建经验,还谈 AIGC 对 SEO 影响等问题。此外介绍上榜机制与参与方式。
BookRAG:专治各种「层次化复杂」文档
BookRAG专为处理层次化复杂文档而生。传统RAG有两大盲区,而BookRAG在多模态长文档基准上刷新SOTA。它采用BookIndex×Agent - based Retrieval技术方案,效率高、可扩展性强,兼顾高精度、高召回、低成本。