模块化双工注意力机制」共找到 301 篇相关文章

推荐文章7

为什么你的 AI Agent 总是用不起来?答案在 Skills

文章围绕AI Agent的Skills展开,介绍其范式价值,如从“单一智能”到“模块化智能”;还提及知识沉淀、跨平台能力迁移等作用,以及对人机关系、人力市场与劳动结构的影响。

AIGC开放社区
新闻资讯7

Claude神之bug:给自己下指令,还诬赖用户??Hacker News炸了

强如Claude也现诸多bug,如分不清发言角色,把恶意注入指令当用户请求。技术根源是Transformer架构注意力机制盲区。网友给出避坑方案,还吐槽Claude算力调整、计费乌龙等问题。

量子位
新闻资讯7

Claude封杀龙虾后推自家Agent服务,又被开源平替了

Claude推出“企业版”服务Claude Managed Agents,是支持模块化组合的API套件,可帮企业构建和部署智能体。但刚发布就被开源项目Multica抢风头,后者在GitHub已获2.6k Star。

量子位
开源动态8

工业级 LLM 数据工程:北京大学 DCAI 团队 DataFlow 框架的架构设计与实践

2026 年大模型研发从‘模型中心’向‘数据中心’演进,数据语义密度与工程精度成突破关键。北京大学 DCAI 团队推出 DataFlow 框架,解决数据准备难题,其技术报告登顶 Hugging Face。该框架有多种特性,实验验证其能提升模型性能。

InfoQ
算法论文8

华为新架构砍了Transformer大动脉!任意模型推理能力原地飙升

即便Transformer是AI世界基石,但遇到复杂数学题或多步逻辑推理时表现不佳。问题出在Attention机制。华为诺亚方舟实验室推出Nexus高阶注意力机制架构,能提升模型推理能力,且参数零增。

量子位
开源动态8

大模型能否为不同硬件平台生成高性能内核?南大、浙大提出跨平台内核生成评测框架MultiKernelBench

深度学习计算依赖底层内核,当前多由开发者手工编写。南大、浙大推出开源评测框架MultiKernelBench,打破现有评测基准局限,构建模块化评测体系,多模型实测,还指出LLM短板并明确未来方向。

机器之心
算法论文8

KDD 2025 Best Paper Runner-Up | EI-BERT:超紧凑语言模型压缩框架

香港城市大学王茂林等提出 EI - BERT 框架,解决移动设备部署 NLU 模型难题。通过硬令牌剪枝、交叉蒸馏、模块化量化,实现 99.5% 压缩率。在多任务中表现出色,已在支付宝大规模应用。

机器之心
算法论文8

GPT-5刷屏吊胃口之际,英伟达发出暴论:小型语言模型才是未来

英伟达新论文指出,未来属于小型语言模型(SLM),挑战了智能体需用大型语言模型(LLM)的假设。SLM参数量低于100亿,有低延迟、低成本等优势,还给出从LLM到SLM迁移路线图。

AGI Hunt
新闻资讯7

更长的推理链反而导致更多幻觉,MLLMs 幻觉解法仅「抄作业」还不够?摘要

近日,斯坦福等校学者发现,更长推理链会让 MLLMs 产生更强幻觉。MLLMs 幻觉不仅涉及语言偏差,还有跨模态语义失配。主流多模态架构在结构设计和训练机制上的潜在失衡,是幻觉频发的主因。

机器之心
算法论文8

CoT推理大溃败?哈佛华人揭秘:LLM一思考,立刻就「失智」

新研究揭示思维链CoT会分散模型「注意力」,使大模型推理时易出错。研究指出在需遵守指令任务中,用CoT推理模型准确率下降,还总结了四大模式,并提出四种缓解策略。

新智元