GPU内核优化」共找到 1628 篇相关文章

产品应用8

世界模型的DeepSeek时刻!魔芯Flash World Model降本70%,跑出50FPS实时交互

魔芯科技发布全球首个超高帧率交互式世界模型 MoWorld,无需高端 GPU,实现影视级画质、50 FPS 实时交互,降本 70%。其技术架构先进,产业化路径清晰,获过亿美元融资。

机器之心
算法论文8

强化学习没作用?人大DelTA精准识别关键token,推理正确率大幅上升

人大高瓴研究团队提出DelTA算法,不依赖经验为强化学习目标中每个token算最优权重。实验显示它适配主流强化框架,在多任务上提升base模型效果,还能让训练更稳定。

量子位
产品应用7

优步通过实时信号与 Listwise 排序改进餐厅推荐

优步在Uber Eats推荐系统引入实时用户信号与Listwise排序法,用实时信号处理层替换早期特征流水线,还引入Listwise排序优化候选餐厅排序,降低特征漂移,保障系统性能。

InfoQ
开源动态8

少 61% Token、多10倍成功率,这个终端 AI 编程代理火了!

现在多数AI编程工具问题多,而在Github上火爆的`oh-my-pi`是运行在终端的AI编程代理,有哈希锚定编辑等实用功能,支持多模型,经基准测试效果好,还能解决实际开发痛点。

开源先锋
新闻资讯7

英伟达想革光模块的命

AI数据中心建设浪潮推动光模块行情上涨,A股光模块三剑客市值超茅台。但英伟达欲用CPO革光模块的命,将光器件集成到电芯片,与台积电合作推进。这会打击中国光模块集成商,不过短期内光模块仍有市场。

远川科技评论
算法论文8

晶圆级芯片和存算一体结合:中科院提出15万tokens/s晶圆级芯片方案丨ASPLOS'26

当前大模型发展对计算硬件需求增长,数据搬运成隐性开销。中科院团队成果Ouroboros实现晶圆级芯片,解决数据搬运问题,虽面临挑战,但性能与能效表现显著,验证了“存算一体+晶圆级集成”路线可行性。

量子位
新闻资讯7

卖鞋厂转型做 AI 股价暴涨 582%,华尔街最不缺这种荒诞闹剧

4月初还在发布新品的鞋履品牌Allbirds,一周后宣布业务转向人工智能计算基础设施,准备更名“NewBird AI”。其股价一日内涨幅超582%,但转型执行难度高,是战略转型还是资本包装存疑。

InfoQ
开源动态8

字节最火的开源Agent项目,如何思考Agent的自我进化?

4月5日,LangChain创始人Harrison Chase阐述对Agent自我进化的思考,认为Agent系统可在Model、Harness、Context三层持续进化。知名开源框架DeerFlow联合作者Daniel也补充了团队思考。

Founder Park
算法论文8

重构线性视觉Transformer,精度与效率双平衡 | CVPR'25

南洋理工、北航与合工大联合提出CARE Transformer,以非对称解耦建模局部与全局,降低计算开销、提升特征表达。实验显示其在移动端低延迟高精度,打破“效率与精度不可兼得”困局。

新智元
开源动态8

OpenClaw 3.24发布:彻底解决最重要的Skills安装障碍!

OpenClaw 3.24 发布,改动显著。Skills 安装更顺滑,系统自动检测依赖;控制台界面大改,侧边栏更易用;修复媒体文件访问漏洞;Microsoft Teams 支持升级;还修了多平台群聊 Bug,新增 API 端点,提升 RAG 兼容性。

新智元