多任务训练」共找到 6662 篇相关文章

开源动态8

百度0.9B参数模型登顶全球第一,聊聊PaddleOCR-VL背后的技术细节

百度PaddleOCR-VL模型仅0.9B参数,在OmniDocBench V1.5榜单获92.6分全球第一,在能力维度达业界最佳,能处理109种语言。其采用两阶段架构,结合优质训练数据,实现高性能与低内存、快速度的平衡。

AIGC开放社区
算法论文8

CVPR 2025 Award Candidate | 英伟达等Difix3D+:用单步扩散模型修复 3D 重建伪影

3D重建领域中,NeRF和3DGS在新视角生成时易出现伪影,影响应用。英伟达团队提出Difix3D+,将预训练2D扩散模型用于3D渲染,单步去伪影,效率高、有泛化力,实验效果领先。

机器之心
开源动态8

Spring AI Alibaba 1.0 GA 正式发布,Java智能体开发进入新时代

2025年AI智能体爆发,Java智能体构建需求激增。Spring AI Alibaba 1.0发布,是基于Spring AI的AI框架,提供智能体框架、生态集成等核心能力,助力Java智能体开发,还规划了持续迭代、可观测评估等功能。

阿里云开发者
新闻资讯8

微软刚发布Mu模型:支持Windows智能体,小参数跑出10倍性能

今天凌晨微软发布创新小参数模型Mu,3.3亿参数性能比肩Phi - 3.5 - mini,体量小10倍,离线NPU笔记本每秒超100 tokens响应。它支持Windows智能体,架构有项创新,经训练优化后智能体表现出色。

AIGC开放社区
新闻资讯7

00后投身具身智能创业,剑指机器人界「Model 3」!已推出21个自由度灵巧手

具身智能创业公司灵初智能推出自研灵巧手,每只手21个自由度,操作能力强。其目标是将机器人整机价格打到17000美元,走‘Model 3式的产业破局之路’,还提出分层端到端算法解决训练难题。

量子位
产品应用7

Sora 2干翻Veo 3?超全对比实测:会中文脱口秀,但体操翻车,附有效邀请码

OpenAI推出Sora2,可生成20秒1080p视频,在物理准确性等方面更优,还具备音画同步能力。文章对Sora2和谷歌Veo3进行轮对比实测,涉及不同场景,也提及Sora2版权保护及App相关情况。

机器之心
新闻资讯7

独家丨华为、联想、富瀚微罕见「同框」,00后空间智能创业者连续获得两轮融资

魔芯科技近日完成新一轮近亿元融资,近两月连续获两轮近亿元融资。其创始人是00后浙大在读博士生。2025年公司研究成果被CVPR2026接收,还发布交互式视频世界模型。采用纯隐式空间表示,在领域有突破。

AI科技评论
产品应用7

Anthropic更新了Skill Creator,评测框架上线

Anthropic更新Skill Creator,上线评测框架。该框架无需写代码,能处理两类技能测试需求,可测试和改进技能,有捕获质量回归等用途。还增加基准模式、Agent支持等,能让技能触发更可靠,更新已在Claude.ai等可用。

AI工程化
新闻资讯8

阿里千问落地谷歌UCP+A2UI,中国率先进入AI办事时代

谷歌联合零售巨头发布UCP和A2UI协议,试图定义智能体商务全球标准。而阿里千问App上线千问任务助理1.0,打通淘宝、支付宝等核心业务,接入项生活与政务服务,快速落地应用,让中国进入AI办事时代。

AIGC开放社区
开源动态8

阿里通义开源GUI智能体SOTA:2B到235B端云协同重新定义移动端GUI智能体

阿里通义实验室开源MAI - UI,通过端云协同架构等解决GUI智能体部署难题。它全谱系模型设计应对硬件约束,自进化数据管线和在线强化学习提升性能,端云协同平衡隐私与效率,扩展动作空间打破局限,在基准测试创SOTA。

AIGC开放社区