长文本训练」共找到 2928 篇相关文章

新闻资讯8

继AlphaFold之后,DeepMind再放“大招”:AlphaGenome直击疾病根源

谷歌DeepMind推出AI模型AlphaGenome,可预测DNA序列微小变化对基因调控的影响,已向非商业研究领域开放。它能处理序列、输出高分辨率结果,有四大优势,在多领域有研究潜力,但也存在局限。

AI寒武纪
开源动态8

开源Agent模型榜第一名,现在是阿里通义DeepResearch

阿里开源首个深度研究Agent模型通义DeepResearch,在多权威评测集上超越多个Agent模型。它采用多阶段数据策略,有两种推理模式,革新训练流程,已赋能高德出行Agent和通义法睿等应用,且模型等均已开源。

量子位
推荐文章7

大模型是不是到顶了?瓶颈到底在哪

文章探讨大模型是否到顶,指出‘到顶’争论分三个问题,靠堆大模型提升能力之路变平,受数据和成本约束。但大模型还有后训练和推理时计算两个发展方向,未来进步或来自更会用算力。

AI Reading Hub
新闻资讯8

一副手套,干翻硅谷炫技派!中国队杀入战场,狂卷100万小时数据

硅谷具身智能玩家为数据发愁,中国灵初智能另辟蹊径,用数据手套采集工人操作数据,成本低且数据泛化性强。其专注物流细分场景,2026年收敛资源做深现有场景,目标推100万小时数据训练模型。

新智元
开源动态8

DeepSeek V4即将发布?先读懂梁文峰这份86页的技术底牌

据报道,DeepSeek计划2月中旬发布V4,此前将R1论文从22页扩充到86页。新增内容涵盖训练细节、成本、数据配方等,还公开失败案例、基础设施和安全报告,或为V4铺路并回应质疑。

花叔
新闻资讯7

The Batch: 865 | 机器人外科医生的切割与夹闭

约翰·霍普金斯大学等团队开发Hierarchical Surgical Robot Transformer(SRT - H),结合两个transformer模型,通过模仿学习训练,用达芬奇机器人完成胆囊切除关键步骤。虽在体外组织测试表现好,但应对人体手术仍有挑战。

DeeplearningAI
算法论文8

监督学习也能从错误中学习反思?!清华英伟达联合提出隐式负向策略爆炸提升数学能力

清华大学与英伟达、斯坦福联合提出监督学习方案NFT,在RFT算法基础上构造“隐式负向模型”利用负向数据训练。该策略弥合监督与强化学习差距,其损失函数梯度和GRPO在On - Policy条件下等价。

量子位
新闻资讯8

马斯克点火全球最大超算,首个1GW狂飙奇点!6万亿Grok 5在训

马斯克官宣全球首个吉瓦级超算Colossus 2上线,狂堆55万块GPU,目标百万。下一代Grok 5已在训练,6万亿参数将引爆智能奇点。同时,全球AI巨头掀起算力军备赛,但美国面临电力短缺难题。

新智元
算法论文8

一个模型统一4D世界生成与重建,港科大One4D框架来了

港科大研究团队提出 One4D 框架,可统一 4D 生成与重建,构造同步输出多模态的视频扩散模型,支持多种任务形态。其有 DLC、UMC 等亮点,用合成与真实数据混合策略训练,实验表现佳。

机器之心
新闻资讯8

Alex Wang“没资格接替我”!Yann LeCun揭露Meta AI“内斗”真相,直言AGI是“彻头彻尾的胡扯”

图灵奖得主 Yann LeCun 在访谈中,尖锐评价当前 AI 发展路径,认为规模化大模型是死胡同。他正通过新公司 AMI 推动“世界模型”技术路线,还谈到 AI 关键要素、安全等问题,与主流观点分歧明显。

InfoQ