「通用化」共找到 1471 篇相关文章
蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争
蚂蚁灵波开源具身智能基座模型LingBot-VLA,用20000小时真实世界数据训练,解锁最大规模开源真机数据之一。它性能超国际顶尖模型,还指明通用具身智能发展路径,为行业提供全栈解决方案。
思维链推理是一种脆弱的‘海市蜃楼’,一旦超出训练分布,它便会消失。| 直播预约
思维链提示能提升LLM在多任务上的表现,让人感觉模型在深思熟虑。但研究从数据分布角度剖析,发现思维链推理是脆弱的‘海市蜃楼’,超出训练分布就会消失,强调实现通用推理能力挑战大。
MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding
文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行时设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。
半年复盘,AI迎来预训练后的新瓶颈。
2025年上半年AI领域发展加速,编码和多模态能力提升。但模型在综合能力上遇到第二轮瓶颈,编码能力强时通用认知能力‘拉胯’,或与RL阶段使用编程数据有关,红杉新基准或推动模型均衡发展。
瘦身不降智!大模型训推效率提升30%,京东大模型开发计算研究登Nature旗下期刊
京东探索研究院大模型研究登Nature旗下期刊。其提出系统与方法,经四大创新使大模型推理提效30%、训练成本降70%。成果支撑JoyBuild平台,可帮企业将通用模型转化为专业模型,加速商业化落地。
SGLang Hierarchical Sparse Attention 技术深度解析
阿里云等团队推出面向 Sparse Attention 的分层稀疏化框架,介绍其架构、机制与实践。此框架破解了长上下文推理时的计算与容量瓶颈,以 DeepSeek DSA 集成测试,使推理性能大幅提升,目前项目处于开发阶段。
让 AI Scientist 真正“做出材料”, 鼎犀智创完成数亿元 Pre-A 轮融资
AI新材料研发公司鼎犀智创完成数亿元Pre - A轮融资,资金用于模型及技术研发等。该公司技术路线独特,案例显示能大幅缩短研发周期,还将中试放大纳入体系,推动材料研发走向平台化。
一台工业具身机器人,从理想到现实要经过哪些坑?
在具身智能赛道,‘落地’常被滥用。聆动通用在‘工业落地’上很果决,以‘商业有闭环’和‘批量可复制’为核心指标。他们选择物流场景起步,推出LDB机器人,还面临量产和运营难题。
Ilya的第一个模型,被曝本月上线
新智元报道,投资人Gavin Baker称Ilya Sutskever创立的SSI本月将发布首个模型。他还提及持续学习等技术或影响英伟达显卡需求,且指出Claude成华尔街“克朗凯特”,带来市场共识同质化。
深度拆解:如何在 LangChain DeepAgents 中复现 Claude 的 Skills 机制 ?
本文探讨在LangChain的DeepAgents框架复现Claude的Skills机制。先回顾Skills,它是Anthropic提出的Agent能力注入方式,有渐进式加载特点。接着介绍让通用框架支持Skills的环节,最后测试验证其效果和收益。