「小目标注意力模块」共找到 994 篇相关文章
没想到,音频大模型开源最彻底的,居然是小红书
近几个月,开源成AI社区焦点,国内厂商七八月开源多款大模型,但音频生成占比小。小红书技术团队自去年起在音频领域稳定开源,成果覆盖TTS、ASR方向,具商用属性,降低落地门槛。
Qwen3-Next:迈向更极致的训练推理性价比
文章发布Qwen3-Next架构及Qwen3-Next-80B-A3B系列模型,通过混合注意力等改进提升训练推理效率。介绍模型结构、性能优势,还说明使用方法,包括在多平台部署及处理超长上下文,展望持续优化架构。
英伟达最新芯片B30A曝光
最新消息,英伟达正开发代号B30A的AI芯片,性能超H20,基于Blackwell架构,单芯片配置,原始算力或为B300 GPU双芯片一半,下月交付测试。此外还将开发RTX6000D用于AI推理,9月小批量交付。
每个人的AI科学助手!全球首个通用科学智能体来了,全网资源+1.7亿学术文献让科研效率狂飙
全球首个通用科研智能体SciMaster在WAIC亮相,由上海交大与深势科技共同发布。它能结合全网资源和1.7亿科学文献,有深度调研等功能,免费且可用于工作生活多方面,还将重塑科研范式。
当博世XC决定像创业公司一样去战斗
本文讲述博世智能驾控事业部(XC)变革故事。2022 年交付遇阻,李金龙小范围改革;2023 年订单减少,吴永桥上任展开变革。博世加大中国业务变革,像创业公司战斗,订单增长,未来左右开弓应对竞争。
告别微调时代:拖拽式LLMs实现12000倍加速适配,输入描述,秒级定制LLM,效果、速度全面超越
传统高效微调技术成大规模部署瓶颈,论文提出Drag-and-Drop LLMs (DnD),仅需输入目标任务未标注提示,即可秒级生成适配的LoRA权重,实现LLM秒级免训练适配,效率、性能和泛化性上均有突破。
田渊栋:连续思维链效率更高,可同时编码多个路径,“叠加态”式并行搜索
AI大牛田渊栋团队利用连续空间“叠加态”让大模型并行推理,提升图可达性等任务表现,为连续思维链提供理论支持。还设计注意力选择器等机制,实验显示连续思维链模型准确率更高。此外,田渊栋还是科幻小说家。
Multi-Agent 的灵活编排之路
文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨多智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。
AI若解决一切,我们为何而活?对话《未来之地》《超级智能》作者 Bostrom | AGI 技术 50 人
本文是对《未来之地》《超级智能》作者 Nick Bostrom 的访谈。他探讨了人工智能发展到解决一切问题的“已解决世界”时人类面临的意义危机,如失去目标、工作冗余等,也提及应对伦理挑战、寻找新意义等观点。
疯了,A社IPO大饼画到30万亿美元!一个美国的GDP
华尔街日报爆料,Anthropic将告诉投资人其潜在收入机会超30万亿美元,已秘密递交IPO草案。该数字是标普1500里191家科技公司去年营收总和的12倍,算法是把AI能接手的工作全算进去。公司内部面试还筛人,很割裂。