「混合注意力」共找到 412 篇相关文章
Deepseek V4 Pro深夜上线,性能追平Fable 5,但价格只有它的2%
2026年8月12日,DeepSeek V4 Pro正式版上线。它是混合专家模型,规模居世界第一梯队。价格比Claude Fable 5便宜超98%,成本优势明显。其架构节省成本,API开放多模式,产品结构清晰。
清华新研究,Nature+Science双杀!
清华大学李勇团队分析2.5亿篇科学文献,揭示AI for Science领域矛盾:虽助科学家个体加速,却致科学界群体注意力窄化。这由当前AI模型缺通用性导致,团队推出OmniScientist系统破局限。
Anthropic顶级Claude模型被逆向开源,这几个模块借鉴了DeepSeek
22岁开发者逆向开源Anthropic的Claude Mythos Preview模型架构,名为OpenMythos。其核心模块借鉴DeepSeek,采用带混合专家路由机制的循环Transformer,有独特设计和稳定机制,重新框定扩展性争论。
Chroma创始人「Context Engineering」5 步杀疯全网
文章聚焦Chroma创始人提出的「Context Engineering」,指出RAG已死,上下文工程崛起,还给出实用建议,如聚焦检索、混合召回等,介绍了上下文工程包含的数据摄入、查询等内容。
这个开源PDF解析器,拿了全球第一
OpenDataLoader在主流PDF解析器基准测试中排第一,尤其是表格提取准确率高。它功能丰富,有本地和混合两种模式,还将推出免费自动标记功能,支持与LangChain集成。
加速200倍,单显卡1.8秒生成5秒高清视频!清华与Vidu解开了视频扩散模型的速度枷锁
清华、生数科技与伯克利联手用TurboDiffusion解开视频扩散模型速度枷锁。它改造注意力机制、引入步数蒸馏和量化策略,在多模型测试中加速100 - 205倍,且画质几乎无损。
Claude Code 推出语音功能,但是,不支持中文
Claude Code推出语音模式,向约5%用户开放。用户按住空格说话,系统自动生成文本,支持语音与键盘混合输入,能提高录入效率,但大概率不支持中文。此外,电报率先支持OpenClaw流式实时回复。
腾讯助力Deepseek完善DeepEP,RoCE提升100%,InfiniBand提升30%
Deepseek团队合并腾讯提交的代码完善DeepEP,称有巨大速度提升,RoCE提升100%,InfiniBand提升30%。DeepEP是为混合专家模型和专家并行设计的通信库,有多项创新特性,适合现代AI应用。
98%准确率!这个双分支AI模型,精准识别木薯叶病害(附代码)
2026年3月论文DenseSwinV2提出双分支AI模型,结合CNN与Transformer,加通道注意力模块突出病害特征。该模型分类木薯叶病害准确率达98.02%,还给出简化版代码,有落地价值。
告别卡脖子,华为黑科技破局!昇腾推理加速1.6倍打破LLM降智魔咒
大模型参数规模大,推理部署难。华为诺亚提出Pangu Light框架,结合算法创新与国产昇腾平台,通过跨层注意力剪枝等技术,解决剪枝后模型失稳问题,实现高压缩率、推理加速与高精度。