「端到端加速」共找到 2803 篇相关文章
怎么量化机器人数据价值?ATHENA将影响函数扩展到十亿参数VLA,313×加速筛选高价值数据
具身智能进入数据scaling时代,VLA模型训练中数据并非越多越好。上海交大同济等校团队提出ATHENA框架,将影响函数扩展到十亿参数VLA模型,解决计算和筛选难题,实现313倍加速,实验证明其用更少数据获更好效果。
生数科技按下B端商业化快进键:30天签约智谱、飞书等多家行业龙头|甲子光年
AI视频生成行业商业化加速,生数科技不到一周官宣与智谱、飞书等合作。其Vidu基座模型能力强,多领域开花,2025年Q1商业化增速快,还凭交付与服务能力获头部青睐。
4.5K Star 超极简!挖到一款更轻量的“纳米级 OpenClaw”,8 分钟直接理解源码!
作者挖到更极简的OpenClaw复刻项目NanoClaw,开源3天获4.5K Star。它基于Claude Agent SDK构建,抛弃臃肿设计,拥抱“定制即代码”理念。功能特性丰富,安全模型升级,核心仓库极简能力可无限扩展。
Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间
Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。
加速200倍,单显卡1.8秒生成5秒高清视频!清华与Vidu解开了视频扩散模型的速度枷锁
清华、生数科技与伯克利联手用TurboDiffusion解开视频扩散模型速度枷锁。它改造注意力机制、引入步数蒸馏和量化策略,在多模型测试中加速100 - 205倍,且画质几乎无损。
24个月,从写第一行代码到破产:一位架构师在47个“死亡”项目里,看到的共同陷阱
架构顾问审阅47家初创公司代码库,发现它们因产品无法扩展、技术债积累走向停滞。提出花两周做架构可避免问题,还指出AI虽降低开发门槛,却加速技术债积累。
32k微调处理百万Token:21倍的推理加速,10倍的峰值显存节省,实现恒定内存消耗
现有大模型处理超长文档易内存爆炸、计算崩溃。阿里巴巴未来生活实验室推出CoMeT架构,有双轨并行记忆系统,能恒定内存、线性时间处理文本,在基准测试超主流方法,实现21倍推理加速和10倍显存节省。
原来Veo 3早有苗头!人大联合值得买科技在CVPR 2025提出全新「图像到有声视频」生成框架
中国人民大学与值得买科技团队在CVPR 2025提出JointDiT框架,可从静态图像生成同步音视频。此研究定义图像到有声视频生成新任务,解决音视频融合难题,实验显示其效果优,还将拓展至四模态建模。
智能流体力学专题研讨会特邀报告3|边鑫:混合深度学习与迭代方法的粘性不可压流动加速求解
2026年8月,第十四届全国流体力学学术会议在青岛举行,智能流体力学专题研讨会展示了人工智能与流体力学交叉领域进展。边鑫作《混合深度学习与迭代方法的粘性不可压流动加速求解》报告,介绍HyDEA求解框架。
5秒完成3D场景编辑,北大&港中文&上海AI Lab搞出VGGT-Edit,120倍加速太炸了
北大、港中文等团队提出原生3D编辑框架VGGT-Edit,不再绕回2D,直接在3D空间编辑。它采用残差场预测等机制,在DeltaScene测试集表现出色,单次编辑约5秒,最高120倍加速。