「深度注意力」共找到 934 篇相关文章
使用 Hugging Face 轻松构建并共享 ROCm 内核
自定义内核是高性能深度学习基础,但构建整合麻烦。Hugging Face的kernel - builder和kernels库可助轻松构建、分享自定义内核。本文聚焦构建ROCm兼容内核,展示构建、测试与分享步骤。
刚刚,MiniMax来承包你的桌面了
2026 年 Agent 赛道竞争白热化,市场分化。国产 AI 大模型独角兽 MiniMax 1 月 20 日推出第二代智能体产品 MiniMax Agent 2.0,从产品形态和能力分布深度重构,是‘AI 原生工作台’,实测表现出色。
刚刚,梁文锋署名开源「记忆」模块,DeepSeek V4更细节了
十几个小时前,DeepSeek 发布新论文,与北大合作,作者有梁文锋。针对大模型问题提出条件记忆,用 Engram 模块实现,已开源。结合此前研究,DeepSeek v4 模样渐清。模型性能、效率表现优,并发现 U 型扩展规律。
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。
模力工场 027 周 AI 应用榜:从“一键生成”到“自动交付”,最会帮你干活的 AI 榜单来袭
模力工场第027周AI应用榜揭晓,上榜产品迈入新阶段,能接管关键环节。如Manus交付调研报告,秒哒将想法变应用,邀虾打通跨境电商流程。还介绍了上榜应用、趋势及上榜机制等。
谷歌DeepMind:AGI不必是巨型模型,拼凑型AI群或率先涌现,管理大规模Agent迫在眉睫
DeepMind最新研究提出,AGI未必以单一巨型模型形式出现,可能由多个次级AGI智能体协作拼凑涌现。为此,团队提出分布式AGI安全框架,包含四层深度防御模型应对新安全挑战。
VGGT4D:无需训练,挖掘3D基础模型潜力,实现4D动态场景重建
香港科技大学(广州)与地平线研究团队提出 VGGT4D,无需训练,通过挖掘 Visual Geometry Transformer 注意力层运动线索,在动态物体分割等任务表现优异,为 4D 重建提供新思路。
中国移动副总经理陈怀达:AI时代,真正的竞争力不在于单一技术的领先
10月19日,中国移动副总经理陈怀达在2025世界VR产业大会演讲指出,VR与AI深度融合,‘AI+’时代有‘三个加速融合’趋势。他还提出关注方向,分享了中国移动‘VR+AI’融合发展体系实践。
企业广泛采用 Agentic AI,但领导层理解滞后
Sauce Labs调查显示,97%公司采用或计划采用Agentic AI用于测试,但61%领导层不完全了解软件测试需求。调查揭示矛盾现象,如受访者既看好自主测试又对数据访问不安。还指出团队与高管期望有差异,需解决不一致。
Databricks与OpenAI合作:企业级私有化GPT-5来了
OpenAI和Databricks深度合作,将把GPT - 5等模型原生集成到Databricks平台。企业可在自有数据环境运行模型,通过SQL等调用,Mosaic AI Gateway保障数据安全,多家企业表示期待。