「多任务训练」共找到 6694 篇相关文章
陈丹琦新作:大模型强化学习的第三条路,8B小模型超越GPT-4o
陈丹琦团队提出结合RLHF和RLVR优点的RLMT方法,支持在基础模型上直接使用,节省后训练成本。它让模型生成CoT,用奖励模型评价输出,使小模型超越大模型,推理更像人类。
谁是最强“打工AI”?OpenAI亲自测试,结果第一不是自己
OpenAI发布新研究,提出GDPval基准衡量AI模型在有经济价值任务上的表现。Claude Opus 4.1表现最佳,GPT - 5次之。OpenAI开源优质子集并提供自动评分服务,还指出了GDPval的局限。
给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集
随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。
Nano Banana不及格,开源模型一分难求!上海AI Lab新基准直击文生图模型痛点
上海人工智能实验室等联合发布首个多学科文生图考试基准GenExam,覆盖10学科、1000题。实验显示,GPT - 4o严格评分正确率仅12.1%,开源模型接近0分,暴露出模型在专业场景的短板。
阿里新开源提出建设性安全对齐方案,向“让用AI的人安全”新范式跃迁
阿里巴巴集团安全部联合多高校发布技术报告,提出建设性安全对齐理念并集成到Oyster - I模型。该理念突破传统防御式机制,构建新博弈框架,实验显示该模型在安全和通用能力上达SOTA水平。
「一人公司」不强求,「Copilots 」更能填平 AI 产业落地的「Massive Delta」?
全球风险投资重心转向AI,2024 - 2025年AI融资额大增。虽资金流向头部通用公司,但Vertical AI交易数量有优势。其能吸引投资是因有商业回报机会,且新兴公司商业指标良好。不过通用模型落地有‘Massive Delta’挑战。
谷歌AI或摘千禧年大奖!华人博士破解百年数学难题,首次捕获奇点
谷歌DeepMind与顶尖机构合作发布重磅论文,用AI在三种流体方程中发现新型不稳定“奇点族”。借助“物理信息神经网络”,开创研究新范式,为数学等多领域带来突破,或攻克千禧年大奖难题。
iPhone 17牙膏挤爆,却没挤出AI!苹果再演诺基亚宿命?
苹果9月推出iPhone 17,其AI功能多是辅助或后台改进,未彻底颠覆体验。谷歌、OpenAI在AI布局领先。AI将重构手机产业,产业链面临洗牌,苹果若不重视AI,可能重蹈诺基亚覆辙。
从「对口型」到「会表演」,刚进化的可灵AI数字人,技术公开了
快手可灵团队让数字人从「对口型」进化到「会表演」,全新数字人功能在可灵平台公测。技术报告Kling - Avatar解析背后技术路径,设计多模态两阶段生成框架,实验显示其在多方面领先竞品。
腾讯悄悄上线了“Claude Code”,居然还支持微信登录。
腾讯悄悄上线CodeBuddy Code(Claude Code),定位为AI CLI,能在命令行完成编程任务。作者测试用其开发MCP服务,速度快且功能全,还介绍使用方法,不过产品有稳定性问题,仍有潜力。