「高性能计算」共找到 3894 篇相关文章
10项评测痛打GPT-4o!智源重磅开源全球最强具身智能大脑
近日,智源研究院开源具身大脑RoboBrain 2.0 32B版本和跨本体大小脑协同框架RoboOS 2.0单机版。RoboBrain 2.0在多项权威具身智能基准上刷新纪录,RoboOS 2.0创新性集成MCP协议与无服务器架构,二者双擎联动推动机器人迈向群体智能。
碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强
国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。
惊艳!GitHub 开发者一键接入!4.2k star 项目 Champ,用一张照片秒变动画
Champ项目致力于从一张静态人物图生成人体动画,将3D参数化人体模型引入扩散模型。它解决了传统动画效果不真实等痛点,有诸多核心功能,技术优势明显,在多领域有高应用价值。
综述 | 从“说出来”到“脑中算”:Latent Reasoning的范式跃迁与无限可能
大型语言模型用显式思维链推理有局限,潜在思维链(Latent CoT)让推理在连续隐藏状态空间进行。论文梳理该领域,建立框架,介绍方法,探讨可解释性与无限深度推理,指出价值、挑战与未来方向。
2025上半年大模型使用量观察:Gemini系列占一半市场份额,DeepSeek V3用户留存极高
推特博主「karminski - 牙医」基于OpenRouter数据,分析2025年上半年大模型API市场,涵盖总Token使用量、市场份额、细分领域用量、API接口使用趋势等,得出各模型表现及市场格局的观察结论。
千卡集群破壁之道:vivo视觉多模态大模型训练效率跃迁实战
多模态大模型在多领域需求增长,但千卡级 GPU 训练挑战大。vivo AI 架构师王兆雄在大会演讲,结合 LLaVA 和 DiT 模型实践,解析优化策略,分享提升训练效率与稳定性的经验,还展望了 AI Infra 未来。
破解「个性化学习」长尾难题,巧用神经坍缩理论 | ICML 2025
当前个性化学习方法基于数据高质量且类别平衡的假设,但现实教育数据呈不均衡分布。华东师范大学和浙江大学团队在ICML2025提出NCAL方法,将神经坍缩理论引入该领域,解决教育数据长尾分布问题。
Transformer死角,只需500步后训练,循环模型突破256k长度泛化极限
线性循环模型能处理极长序列,是相比Transformer的关键优势,但过去循环模型性能不足且难以泛化。CMU等研究者证明,通过简单训练干预,循环模型500步后训练可突破256k长度泛化极限。
比女皇报告还炸裂!67页AI深度调研刷屏,全球LLM大决战真正开始
硅谷财富管理巨头Iconiq Capital发布《2025年AI现状报告》,实测300家AI公司落地路径,揭示AI从概念走向实战的七大真问题,解析从构思到部署AI产品路径,核心关注高效构建、规模化落地等。
文心大模型 4.5 系列正式开源,涵盖 10 余款模型
6月30日,百度正式开源文心大模型4.5系列,含10款模型,实现预训练权重和推理代码全开源。可在飞桨星河社区等平台下载,百度实现框架与模型“双层开源”,技术创新多,性能表现优。