工程团队管理」共找到 4414 篇相关文章

算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。

深度学习自然语言处理
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用旋转位置编码 (RoPE) 的现代Transformer模型中,注意力机制的查询 (Q) 和键 (K) 表示存在集中极大值,而值 (V) 表示无此模式。研究通过实验揭示其与上下文知识理解的关键联系。

机器之心
新闻资讯8

华为首发企业AI白皮书:AI让员工更快了,怎样让整个企业受益?

本文为量子位报道,华为在全联接大会2026首发企业AI白皮书,针对当前企业AI单点提效难转化为整体业务收益的痛点,提出企业智能化建设的参考架构与工程落地路径。

量子位
算法论文9

给视频模型建一座「全能训练场」:300项任务、可验证奖励,VBVR-Pro系统探索视觉推理

针对原生视觉推理缺少完整训练评估基础设施的现状,NTU等多校联合推出VBVR-Pro系统,构建了从任务构建、模型训练、能力评测到强化学习优化的完整闭环,论文、数据、代码均已公开。

机器之心
推荐文章9

本地该怎么做RSI?我们与StartLux CTO聊了聊

菲尔兹奖得主联名信引发AI数学研究争议,前沿研究开始防备云端AI,但本地AI能力不足。本文专访StartLux CTO郭权玮,深度讨论本地RSI实践路径,披露Auto Research方法、实验数据与安全方案,介绍本地模型研发进展。

机器之心
新闻资讯8

十万卡,不是把十万张GPU插在一起

本文拆解十万卡GPU集群的核心痛点,指出其难点并非硬件堆叠,而是系统调度、稳定性等工程能力,介绍摩尔线程全栈布局及与京东云合作打造国产十万卡集群的行业信号。

芯师爷
新闻资讯8

陈大年复出,入局大模型

国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在信通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。

量子位
新闻资讯8

李飞飞首个多模态世界模型 Atlas 正式发布:从零开始预训练,几张图就能构建世界

李飞飞创办的 World Labs 发布多模态世界模型 Atlas,可原生处理多类型数据,有世界生成、重建和模拟等能力。还介绍其研发历程、技术特点,以及 World Labs 收购、融资等情况。

InfoQ
新闻资讯7

速递|前字节Seed强化学习专家孙鹏加入星尘智能,将大模型后训练经验带到物理世界

9月2日消息,前字节跳动Seed团队强化学习专家孙鹏博士加入星尘智能,负责机器人强化学习方向。星尘智能有技术、资本和商业优势,孙鹏经验丰富,此次加入将助力其强化学习后训练发展。

AI前线
新闻资讯8

独家专访临界点CEO乔天杰:机器人运动会7冠背后,灵巧手真正该比什么?|甲子光年

8月22 - 26日,第二届世界人形机器人运动会举行,灵巧手首次单独参赛。临界点携OmniHand获7金4银3铜,CEO乔天杰接受专访,探讨灵巧手能力衡量、自由度、工程化及产业应用等问题。

甲子光年