「全注意力机制」共找到 2728 篇相关文章
让思考更准更长!强化学习新算法FIPO来了
阿里通义实验室Qwen Pilot团队发布系列博客剖析大模型强化学习机制与局限,推出新算法FIPO。该算法引入Future - KL机制,解决‘推理长度停滞’问题,在多项测试表现优异,还介绍招聘信息。
无锡梁溪国资领投!长三角商业航天再落关键一子
继4月数亿元Pre - A轮融资后,龙擎空天近日完成近亿元Pre - A+轮融资,由无锡梁溪国资平台领投。两轮融资用途明确,其‘终端 + 芯片’模式有独特优势,还启动‘算力上天’战略,折射商业航天产业变革。
从入门到用好 Agent Skills,看这一篇就足够了
文章是全面的 Agent Skills 中文指南,介绍其架构理念、机制、开发指南等。Claude Skills 价值被低估,它像通用 Agent 扩展包,非技术人员也能开发,还探讨了使用、开发时机与核心运行机制。
ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链
随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。
从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓
4月16 - 18日QCon全球软件开发大会·北京站(2026)圆满举办,超2000人参与。多位技术领袖围绕AI与工程实践分享见解,大会还设25大专题。最后揭晓17位优秀出品人和29位明星讲师。
AI生成内容如何确权?全国首部区块链知识产权存证标准启动编制,欢迎参与起草!
区块链存证技术能解决知识产权确权、举证、维权难题,但实践中存证流程不规范等问题凸显。全国首部《基于区块链的知识产权存证管理规范》团体标准立项,正征集起草单位和起草人,可解决企业核心困境。
三家中国工博会参展商,在半导体两场革命中改写格局
2025中国工博会首设集成电路展区,超90%为专精特新企业。在CES 2026上,曾参展的中国展商再登场。瑞芯微、新思科技、移远通信携方案突围,参与半导体算力与场景创新两场变革。
一个模型装下整个物种树!伯克利GPN-Star斩获基因预测双料冠军
加州大学伯克利分校等机构推出基因组语言模型GPN - Star,可将全基因组比对和物种树信息装进大模型。它克服传统GLMs短板,实现三点升级,在多基准测试表现出色,是强大的全基因组变异解读框架。
FlashAttention-4震撼来袭,原生支持Blackwell GPU,英伟达的护城河更深了?
在 Hot Chips 2025 上,TogetherAI 首席科学家 Tri Dao 公布 FlashAttention-4,其在 Backwell 上比英伟达 cuDNN 库中的注意力核实现快 22%,还实现两项算法改进。该技术一直迭代升级,提升了注意力计算效率。
他想让TPU成为AI界的X86!
2026世界人工智能大会期间,中昊芯英主办分论坛,新一代全自研TPU架构AI芯片“须臾®”亮相,华东地区首个国产TPU智算千卡集群落成。“须臾®”算力强、成本低,集群全链路国产化,中昊芯英探索TPU突围路径。