多任务学习」共找到 6168 篇相关文章

开源动态8

又是王冠:27M小模型超越o3-mini!拒绝马斯克的00后果然不同

27M小模型HRM由拒绝马斯克的00后王冠开发,超越o3 - mini - high和DeepSeek - R1,推理不靠思维链。它采用分层推理等五项核心技术,在测试中表现出色,虽被指通用性不足,但有人看好其仿脑架构。

量子位
开源动态7

小红书发布 SWE-Bench Mobile:当 AI Agent 面对亿级用户 App 代码库,最高通过率仅12%?

小红书联合科研机构发布 SWE-Bench Mobile,它是首个还原‘端到端’开发流程的基准,以小红书 App 实际任务为核心。评测显示,AI Agent 在移动端开发能力上限低,架构设计比模型本身重要,简单提示策略效果更好。

InfoQ
算法论文8

EMNLP 2025 | T2R-bench: 业内「首个」工业级表格生成报告评测基准

中国电信人工智能研究院推出业内首个面向真实工业场景的“表格到报告”基准T2R-bench,涵盖领域真实表格、问题与人工标注关键点,配套创新性三维度评测体系。实验显示主流大模型在该任务上表现欠佳,提升空间大。

AINLPer
新闻资讯8

干货满载!腾讯云AI技术周圆满收官,回顾如何利用AI增效创收

2025腾讯全球数字生态大会启幕前夕,腾讯云联合InfoQ打造「AI技术周」,9月8 - 14日直播输出,围绕关键议题邀大咖对话,公布项AI+产品进展,涵盖降成本搭应用、AI Agent落地、数据库智能进化等内容。

InfoQ
新闻资讯8

击败PI ,清华系具身公司包揽「具身奥林匹克」三项全球第一,刷新世界纪录!

在Benjie's Olympics赛事中,星动纪元凭借自研具身智能模型获三项全球第一,击败具身领域老牌公司PI。该赛事规则严苛,星动纪元在剥橘子、开锁、翻袜子任务中表现出色,此前其在技术研发和场景落地也成果颇丰。

AI科技评论
新闻资讯8

GTC 巅峰对话 Jeff Dean x Bill Dally:预训练范式已死、延迟瓶颈不在计算、谈透 AI 五年未来 | GTC 2026

GTC 2026上,NVIDIA首席科学家Bill Dally和Google Jeff Dean展开重磅对话。讨论了模型能力进步、低延迟推理架构、模型自主进化、数据与算力、训练与推理硬件差别等方面内容,分享对未来AI的看法与见解。

AI科技大本营
推荐文章8

AI大模型开发核心技术栈:从框架到部署的全景解析

本文为开发者提供2025年AI大模型开发核心技术栈图谱,解析四大核心支柱技术。基础开发框架含深度学习与AI Agent框架;模型训练与微调有分布式训练、参数高效微调;推理优化含关键技术与主流框架;AI编程辅助工具分主流形态且有发展趋势。

AIGC开放社区
产品应用8

20亿美金苏度科技具身首秀即大招!0真机数据,zero-shot,跑出98%首次抓取成功率

苏度科技发布软硬件全栈自研的机器人系统R1,采用世界模型与强化学习一体化设计,在不使用真机数据的前提下,实现关键任务近100%的Zero-shot成功率。苏度团队通过重新定义数据范式,解决了具身智能发展的核心瓶颈。

量子位
开源动态8

社区供稿 | Hugging Face x 北京中关村学院等机构联合发布生成式基因组大模型Carbon:一场关于“生命语言”的范式革命

北京中关村学院等联合发布生成式基因组大模型Carbon并开源。Carbon家族有三个版本,旗舰模型Carbon - 3B在任务匹敌70亿参数的Evo2 - 7B,运行速度快275倍。它在数据、分词、训练上有创新,还实现技术普惠,有种应用场景。

Hugging Face
算法论文8

阿里:RL强化LLM推理,是技巧还是陷阱?

近年来,强化学习(RL)成为解锁大型语言模型(LLM)复杂推理能力的关键工具,但该领域也面临技术选择困境。阿里联合所高校的论文通过大规模可复现实验,揭示主流RL技巧的机制与适用场景,还发现极简组合(Lite PPO)性能超越复杂方案。

深度学习自然语言处理