「经济基元」共找到 862 篇相关文章
大模型推理也能“智能调度”:让奖励模型按需分配算力的动态路由机制 | ACL 2026
生成式奖励模型(GRM)推理策略存在算力浪费问题。腾讯混元与新南威尔士大学联合提出 E - GRM 框架,将模型不确定性定义为调度信号,按需推理。文章从多维度解读该框架,并展示实验评估结果。
GPT-5得分不到0.4!法律+金融最大规模基准:1.9万+专家评估准则
新推出的PRBench基准可测AI在金融和法律领域表现。它有19356条专家评估准则,是该领域最大公开基准。顶尖大模型在困难子集得分低,还独创经济路径分析维度,约30%任务为多轮对话,揭示了AI在专业领域的不足。
谷歌助力神经科学飞跃,破解斑马鱼全脑活动密码
谷歌等机构科学家联合发布开创性研究成果ZAPBench,这是预测斑马鱼全脑活动的基准测试平台。它含超70000个神经元4D光片显微镜记录,设计多种刺激条件采集数据,有特定基准测试任务和评估指标。
MoE不够看了,腾讯推出MoT:2B具身模型22项评测16项最佳
腾讯混元团队联合Robotics X实验室推出HY - Embodied - 0.5系列基础模型,含MoT - 2B和MoE - 32B两款主力模型。在22项评测中,MoT - 2B获16项最佳,其架构、数据和训练有创新,能应用于机器人控制。
深谋商业化一骑绝尘!人形机器人中标国网电力,大载重eVTOL即将首飞
深谋科技在今年世界人工智能大会上大放异彩,其融合多模态感知检测的人形机器人中标国网河北电力项目,相关技术将应用于关键研究和装置研制。此外,其大载重eVTOL曜眸MX150E无人机即将首飞量产,有望成低空经济出海冠军。
GPT-5.2被曝作弊!偷袭谷歌竟靠拉爆token刷高分,不如Gemini 3
新智元报道,OpenAI刚发布GPT - 5.2就被指「作弊」,其在基准测试中或调参数使模型用更多算力资源。有用户发现它消耗远超对手的token才获成绩,真实能力或与Gemini 3相当。此外,还揭示了OpenAI为商业利益牺牲学术独立的问题。
硅谷火了一年的 AI Roll-Up,正在把“买公司”变成新的 AI 创业模式
文章指出,AI投资正从“卖工具”走向“拥有运营”,AI Roll - Up模式兴起。它回应了AI SaaS的结构性困境,经济模型与传统PE roll - up有别。五个趋势加速其发展,但也面临整合、竞争等风险,还介绍了投资地图和幕后资本力量。
7B模型“情商”比肩GPT-4o,腾讯突破开放域RL难题,得分直翻5倍
腾讯混元AI数字人团队提出RLVER框架,解决开放域RL在真实交互中的‘情商’优化困境。经其训练的Qwen2.5 - 7B模型在情感对话基准得分跃升,比肩顶级商用模型,团队还有诸多启发性发现。
11.77亿资本押注卡车新势力「一哥」,L2升维路线率先在商用车跑通!
2026年初,自动驾驶卡车新势力DeepWay深向完成11.77亿元Pre - IPO轮融资,国资、外资、产业资本齐参与。该公司靠卖新能源重卡营收可观,采用L2升维L4的战略,自研重卡与智驾技术成熟,其发展路径获资本看好。
英伟达新研究:小模型才是智能体的未来
英伟达最新论文指出,大模型在Agent任务中消耗大量计算资源,成本高、效率低、灵活性差,而小模型能在性能够用前提下让任务执行更经济灵活。小模型通过优化硬件资源和任务设计高效执行任务,但落地面临挑战。