含模量」共找到 1089 篇相关文章

算法论文8

华人团队终结Token危机:扩散型数据潜力超自回归三倍

最新研究发现,token数受限下,扩散语言型数据潜力超自回归型三倍多。一个1B参数的扩散型用1B tokens训练,在基准测试取得不错准确率,且未现性能饱和。

量子位
推荐文章7

深入剖析AI公司正在面临的:「囚徒困境」

文章指出AI型训练成本虽下降,但运营成本尤其是推理费用飙升,使AI公司陷入两难。用户只青睐最强型,且型资源消耗远超预期,订阅式难以为继,还给出了避免亏损的三条出路。

AINLPer
推荐文章7

Token成本下降,订阅费却飞涨,AI公司怎么了?

文章指出,虽型训练成本下降,但 AI 公司运营成本尤其是推理费用猛增。以固定费率订阅和高 token 消耗的商业式的公司面临困境,如 Windsurf、Claude Code 等,还给出避免亏损的三条出路。

机器之心
新闻资讯7

独家丨小鹏机器人团队“广招兵马”,原字节 Seed 陈杰已加入

AI科技评论独家消息,小鹏机器人团队正招人,原Seed强化学习大佬陈杰已加入。此前鹏行团队规有过缩减,如今行业竞争加剧,其重又开启招兵买马。小鹏在机器人领域投入已久,何小鹏还表示会继续加大投入。

AI科技评论
算法论文8

无需训练,即插即用,2倍GPU端到端推理加速——视频扩散型加速方法DraftAttention

高质视频生成任务中,扩散型成主流,但DiT型注意力机制计算大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。

机器之心
算法论文8

我在哪?要去哪?要怎么去?字节跳动提出Astra双型架构助力机器人自由导航

当今机器人导航系统在复杂室内环境面临挑战,字节跳动研发创新双型架构Astra,Astra - Global与Astra - Local子型。经实验验证其性能佳,未来有广阔应用前景,但也存在需改进之处。

机器之心
产品应用8

谷歌Gemini 2.5全线爆发!勇战「濒死恐慌」,却被丝血宝可梦吓到当场宕机

谷歌旗舰Gemini 2.5全家桶三款型昨夜上线,包括正式版2.5 Pro、2.5 Flash及预览版2.5 Flash - Lite。技术报告显示其性能提升显著,还在玩宝可梦时惊现类人恐慌,推理性能下降。

新智元
8

硅谷顶尖产品教练万字干货,一针见血揭示产品失败真相

文章回顾 Jim Morris 演讲,指出多数团队混淆“产出”与“成果”,迷恋“虚荣指标”。以 Power Reviews 为例,强调做对事才驱动客户价值。还介绍衡成功的指标及应用案例,说明指标关联与先行指标作用。

AI科技大本营
开源动态7

DeepSeek R1/V3作者开源轻级vLLM,1200行代码读懂大型推理技术!

DeepSeek R1/V3作者俞星凯开源轻级vLLM——Nano - vLLM。它有快速离线推理、代码可读、优化套件等特性,还给出了RTX 4070等硬件和Qwen3 - 0.6B型的基准测试配置。

PaperAgent
7

ASML,一夜崩盘?

全球光刻机霸主ASML市值十个月蒸发超1300亿美元,原因有财报提前泄露、销售预期下调,还受美国出口管制、客户冷遇等影响。同时介绍其核心业务、市场地位,也提及中国光刻机自主研发进展与挑战。

芯师爷