「预训练范式」共找到 2905 篇相关文章
LLM协作告别文本形式:直接“脑对脑”,Cache-to-Cache实现语义瞬时传输
现有多LLM系统依赖文本通信,效率低且易失真。论文提出Cache - to - Cache(C2C)范式,让LLMs通过KV - Cache“脑对脑”交流,实现高效精准语义传输,在多类任务中提升性能与效率。
老思维做 Agent,没戏!云厂商们又想憋大招了
企业落地 Agent 经历快速演化,自主性 Agent 成新趋势。云厂商起初推 AI Infra,现转以 Agent 应用为中心开启 Agent Infra 赛道竞争,虽已布局但新开发范式未成型,未来需产业链协作迭代。
忘掉大模型,微软实证:小模型才是Agentic AI的未来!
过去两年大模型在数学竞赛题上靠Test - Time Scaling发展遇天花板。微软rStar2 - Agent让14B小模型学会‘写代码→跑结果→改思路’,表现出色。还介绍了其基础设施、算法、训练配方等方法。
波士顿动力Atlas人形机器人再现逆天进化:通用AI机器人真的要来了
波士顿动力为Atlas人形机器人训练全新大型行为模型LBMs,它是语言指令驱动的策略模型,能完成复杂操作任务。构建模型有四步骤,实践遵循三大原则,还展示了其多方面操作能力与特点。
突发!字节开源 36B 模型Seed-OSS
字节跳动Seed团队开源Seed-OSS系列36B模型,用12T tokens训练,采用Apache-2.0许可证。该模型能灵活控制推理预算,有两个基座版本,Instruct版在多方面表现强劲,性能碾压OpenAI开源模型。
刚刚,OpenAI神秘新模型斩获IMO 2025金牌!攻克奥数巅峰,硅谷沸腾
OpenAI用全新通用推理模型夺下IMO 2025金牌,解出5道题狂揽35分,远超此前Gemini 2.5 Pro的13分。此或意味着其研发出颠覆性推理技术,告别CoT,且模型未针对IMO训练,有持久创造性思维。
抛弃预定义Tool,首次提出通过动态工具生成的Agentic多模态Reasoning,破31%涨幅
视觉推理任务中,传统多模态大模型依赖预定义工具,灵活性与领域适应性差。PyVision 框架首次让 MLLM 在推理中实时生成、执行并迭代 Python 工具,在多类任务中显著提升性能,实现范式跃迁。
比英伟达早,比李飞飞强,大晓Kairos原生一体化世界模型定义物理AI新路线
大晓机器人发布 Kairos 开悟世界模型,其首创“多模态理解 — 生成 — 预测”原生一体化架构,采用跨具身渐进式训练体系和“以人为中心”的数据金字塔,还实现端侧部署,在四大权威具身智能基准上全面登顶。
当 Token 成为商品,AI 基础设施会怎么变化?
在大模型时代,智能生产和交付未实现工业化,存在性能鸿沟。九章云极提出AI工厂战略,发布Alaya NeW Cloud 3.0,将从资源计量转向智能计量,打造训练和Token工厂,提升算力到有效Token的转化效率。
GPT-Image-2平替!最强开源生图模型来了
OpenAI推出GPT Image 2引发AI生图大战,国内厂商商汤反击,推出多模态理解生成模型SenseNova U1并全面开源。它通过自研架构实现理解、推理、生成统一,实测表现惊艳,能力全维度,与GPT-Image-2范式不同。