图像超分辨率」共找到 2513 篇相关文章

产品应用7

机器人是具身大模型的「用户」:维动力如何打通从人类经验到机器人行动?

今年WAIC,维动力展台的乒乓球桌和双臂机器人开易拉罐演示吸引关注。其机器人90%经验来自人类第一视角数据,维动力全栈布局,试图打通人类经验到机器人行动链路,目标是建立机器人持续进化方式。

机器之心
算法论文8

华为树HTP:不写示例、不调PDDL,AI规划约束通过率飙升62.6%

文章介绍华为树HTP,它是完全自主、可泛化的推理新范式。能让LLM在树结构上完成规划,不依赖人工示例和外部规划器,在复杂规划benchmark上实现SOTA准确率并降低token成本,还阐述其原理、创新点及应用实例。

CourseAI
8

华师大智金院孵化金融原生基模Mint-Agent:越GPT-5.6与Claude Opus 4.8,商业订单已亿元

华东师大智金院团队孵化的金融原生基模 Mint - Agent 发布,在 FinanceAgentBench v2 上表现 GPT - 5.6 - Sol 与 Claude Opus 4.8,单题推理成本低,商业订单亿元,进入规模化金融场景验证阶段。

机器之心
产品应用8

Luma Uni-1.1 API开放,图像模型榜单第三,文字渲染直逼GPT image 2

今年图像生成模型迭代快,海外AI初创公司Luma将统一图像模型Uni - 1升级到1.1版并开放API。它在榜单排名前三,价格与延迟低,有诸多品牌客户接入。展示了多场景应用效果,技术路线独特,定价有优势。

机器之心
开源动态8

牛!小米开源「音频语言模型」,1亿小时预训练时间,音频理解和输出能力是真顶!

小米推出开源音频语言模型MiMo - Audio,有1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。

开源AI项目落地
开源动态8

仅需0.7秒单图像实时3D重建,开源扩散模型

图像3D重建是计算机视觉难题,传统基于回归和生成式方法各有局限。Stability - AI开源SPAR3D模型,融合两种方法规避局限,仅0.7秒完成单图实时3D重建,实验显示性能显著优于其他基线方法。

AIGC开放社区
新闻资讯7

独家|拿下5亿元海外订单,无界动力完成天使++轮融资,天使轮累计融资2亿美元

AI科技评论独家获悉,通用具身智能机器人公司无界动力完成天使++轮融资,累计2亿美元,天使+++轮也接近完成。其以隐空间世界模型构建具身大脑,区别于主流架构。还获远景5亿订单,商业化落地成果多。

AI科技评论
开源动态7

Claude时代终结?LMArena实测DeepSeek R1编程得分Opus 4,但月暗称其新模型更胜一筹

在闭源模型主导的AI环境下,开源的DeepSeek - R1(0528)在LMArena测试中表现亮眼,编程得分Claude Opus 4,引发社区关注与讨论。不过LMArena曾被指责偏袒,其联合创始人反驳。此外,月之暗面新模型Kimi - Dev - 72B编程成绩R1。

AI前线
产品应用8

“图片秒生”,腾讯混元图像2.0模型正式发布,主打速度和真实感

5月16日,腾讯发布混元图像2.0模型,率先实现实时生图,生图速度快、质量高,能避免‘AI味’。在GenEval基准上准确率95%,还发布实时绘画板功能,后续将推原生多模态模型。

AI科技大本营
开源动态8

一个模型了DeepSeek R1、V3,参数671B,成本不到350万美元

Deep Cogito 是旧金山 AI 初创公司,开源四款混合推理模型。最大 671B MoE 模型性能 DeepSeek v3 等,推理链比 DeepSeek R1 短 60%,训练成本不到 350 万美元。核心方法是迭代蒸馏与增强。

机器之心