高分辨率图像感知」共找到 792 篇相关文章

新闻资讯7

马斯克终于成『AI No.1』,6大案例看实力与水分

马斯克发布Grok 4,宣称其超越OpenAI等LLM。它屠了各种榜单,但Grok系列口碑欠佳。文中通过多案例测试,展现其在各方面的表现,如编码、数学、图像等,还提到了API速度和价格。

鲸选AI
产品应用7

Qoder @database功能上线!自动关联数据库 Schema,后端 AI Coding 效率拉满

Qoder JetBrains插件上线@database功能,将数据库能力内置为核心上下文,可一键让AI结合真实业务表结构处理SQL编写等任务。它是JetBrains上唯一深度支持“数据库原生感知”的AI Coding插件,还介绍了使用方法、场景及注意事项。

阿里云开发者
产品应用8

实测 Seed 2.1:豆包基模超进化,国产模型能力跨过质变点

作者在做面向 Agent 项目时,因 Claude Code 内存开销大,需更轻方案。火山引擎 Force 大会发布 Seed - 2.1,作者实测其在办公、编程、图像理解等方面表现出色,认为它跨越质变点,将赋能国内 AI 生态圈。

特工宇宙
产品应用8

豆包 Seed 2.0 Lite升级:给 Agent 装上眼睛和耳朵

近期模型发布竞争激烈,作者做视频字幕常遇识别错误,因语音识别工具缺上下文。字节方舟的豆包 Seed 2.0 Lite 升级后能听,还可结合上下文准确输出字幕,成本降 20%,也能理解视频,为工作流补全感知

花叔
产品应用7

新鲜出炉!谷歌nano banana模型刷屏背后技术揭秘

谷歌Nano Banana模型刷屏,其项目负责人等揭秘技术。它有场景一致性、文本渲染等特性,团队用文本渲染能力作评估指标,还靠原生多模态、交错式生成等技术,结合用户反馈实现多方面进步,图像模型做PPT尚处起步。

AI寒武纪
开源动态8

浙大开源PhyEdit:单图编辑+精准3D物体操作 | ACM MM'26

浙江大学ReLER团队开源的PhyEdit,用3D foundation model明确目标几何,让DiT图像编辑器负责最终渲染。单张图片里物体能移动并形成连续状态,在多项指标表现出色,还具备多种能力,已被ACM MM 2026接收。

新智元
新闻资讯7

没了遥控器,还被扔进荒野,具身智能该「断奶」了

在第五届ATEC科技精英赛上,人形机器人在户外场景状况百出,如摔倒、罢工等。专家认为过去高估其通用能力,五年内走进家庭承担家务较难。具身智能面临感知、决策、硬件等难题,但也有队伍取得成果。

机器之心
算法论文8

直播预约 | SwS: 强化学习训练能否不依赖外部知识优化模型的弱点?

该论文提出强化学习场景下的启发式数据合成流程(SwS),利用模型自我感知弱点驱动自动化问题生成,弥补推理缺陷。对其扩展后适应性更广,在多基准测试集和模型上验证有效,性能提升显著。

深度学习自然语言处理
产品应用8

腾讯用AI把美术管线重新做了一遍,混元3D Studio架构曝光

腾讯推出专业级AI工作台混元3D Studio,可覆盖3D资产生产全流程,让生产周期大幅缩短。它有组件拆分、可控图像生成等七大核心技术模块,各模块对应关键阶段,实现无缝衔接与自动化。

量子位
新闻资讯8

刚刚,首个能在机器人上本地运行的具身Gemini来了

谷歌DeepMind推出Gemini Robotics On-Device,这是首个可部署在机器人上的VLA模型,无需联网,能让机器人适应新任务和环境。还将发布SDK助开发者评估。此外,谷歌下调Gemini免费额度,推出图像生成模型Imagen 4和Imagen 4 Ultra。

机器之心