可验证评分机制」共找到 1677 篇相关文章

新闻资讯8

刚刚,GPT-5.4 发布,百万上下文、最强全能模型

OpenAI发布GPT - 5.4,集推理、编程等能力于一体,支持百万级上下文窗口。有三个版本,功能全面升级,如支持中途打断、电脑操作、视觉能力提升等,还更省token、少幻觉,安全机制完善,价格有调整。

AGI Hunt
算法论文8

告别死记硬背!SkillRL自动提炼Skills持续进化

大型语言模型智能体常孤立运行,难从经验学习。SKILLRL受人类技能启发,提出有效经验迁移需抽象。它通过经验驱动的技能蒸馏、分层技能库和递归技能进化机制,在多实验中表现出色。

PaperAgent
算法论文7

VL-LN Bench:模拟「边走边问找具体目标」的真实导航场景

上海人工智能实验室等研究者完成VL - LN Bench,模拟真实导航场景。它构建自动化数据收集管线,依托InternVLA - N1训练评测。结果显示主动对话可提升表现,但当前方法在实例感知对齐等环节有短板。

机器之心
产品应用8

谷歌新模型登顶Nature,人类基因密码被解码

谷歌推出全新AI工具AlphaGenome,能精准预测人类DNA序列变异对调控基因生物过程的影响。它满足多项条件,在26个变异效应benchmark中25个达SOTA,还通过多个案例和实验验证了其性能。

PaperAgent
新闻资讯8

【AAAI 2026大会特邀报告】从推理到科学发现:AI迈向可精专通才之路

上海人工智能实验室周伯文在AAAI 2026大会提出,当前处于AGI前夕,需通专融合智能。他认为可深度专业化通用模型是实现AGI的可行路径,科学发现是AI前沿,还介绍了SAGE架构及相关成果。

OpenMMLab
新闻资讯7

ClawdBot,正在引爆全球灾难!各大CEO预警:不要安装,不要安装

一夜爆红的ClawdBot存在端口裸奔、无鉴权、可被远程接管等问题,已引发暴力破解、数据清空等情况。各大CEO预警其将酝酿全球灾难,并给出修复建议和让其更安全的方法。

新智元
算法论文8

定位大模型「作弊」神经回路!新研究首次揭示:虚假奖励如何精准激活第18-20层记忆

此前学术界发现大模型用虚假奖励训练也能提升准确率,背后微观机制是黑盒。南科大等团队深度拆解,定位到关键记忆节点,发现‘困惑度悖论’,还能操控记忆,成果对评估、检测和去污染有意义。

量子位
推荐文章7

Agent时代,为什么多模态数据湖是必选项?

AI时代,数智化底层是基建深耕。企业要构建多模态数据湖,因其能处理多模态数据,唤醒沉睡数据,驱动业务,还提供工程确定性。火山引擎给出升级路线及选型指南,其多模态数据湖已在多行业落地。

机器之心
算法论文8

Meta&CMU:Token级LLM协同路由新范式

Meta AI、CMU等联合推出FusionRoute,是让多个大模型在token级协作的新范式。它能在每个token位置精准选专家,自带“急救包”。经实验验证其高效,也指出了待研究的方向。

PaperAgent
开源动态8

AI4S又一瓶颈被攻克:两个AI「吵架」,让科研代码部署成功率突破95%

科学软件大多难直接运行,制约AI4S与Agentic Science发展。Deploy - Master应运而生,是一站式自动化工作流。Search Agent筛选工具,Build Agent用双模型辩论机制使部署成功率超95%,为科学智能体交互打基础。

量子位