视觉精准度」共找到 1233 篇相关文章

产品应用7

AI视频生成产品:多模态输入成标配,角逐一站式生成能力 | 量子位智库AI 100

Sora2下载量破百万引发AI视频生成热潮,谷歌推出Veo3.1再掀高潮。国外大厂将其卷至电影制作级创意,国内企业追求高质量、秒级生成并落地垂直场景。量子位智库发布的产品呈现多维技术演进。

量子位
产品应用7

8个月营收提高4倍,n8n如何成为AI Agent最受欢迎的搭建平台?

n8n由前《加勒比海盗》视觉设计师创立,从工作流自动化工具升级为AI应用编排层。8个月营收提4倍,正进行超1亿美元融资。它能与AI无缝集成,有活跃社区,在多场景应用广泛,不过用户多为技术人员。

Founder Park
产品应用8

字节最强多模态模型登陆火山引擎!Seed1.5-VL靠20B激活参数狂揽38项SOTA

5月13日,火山引擎在上海发布5款模型和产品,其中豆包1.5・视觉思考模型(Seed1.5-VL)最吸睛。它激活参数20B,性能与Gemini2.5 Pro相当,38个评测基准达SOTA,推理成本低,已开放API。

机器之心
算法论文7

把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。

AI科技评论
算法论文8

打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来

近期,利用视频生成模型为机器人构建“世界模型”成热门路线,但存在“可执行性鸿沟”。港中深 - 跨维智能团队提出 EVA 框架,用强化学习优化视频生成,实验显示其能提升视觉规划、仿真任务成功率及真实部署稳定性,还有数据合成潜力。

机器之心
新闻资讯7

给 Agent 接搜索功能,有哪些「坑」需要特别注意?

搜索是AI产品标配,但给AI接搜索不易,给人用和给AI用的搜索差异大。信息检索质量影响Agent推理与任务完成。邀请小宿科技相关人员聊给Agent接入搜索能力,10月30日20点线上闭门活动可扫码报名。

Founder Park
产品应用8

Sora 2刷屏全网:拍《瑞克和莫蒂》、过物理测试,太棒了

OpenAI推出的Sora 2刷屏海外,能完成以往视频生成模型极难实现的任务,在物理准确性、逼真和可控性上有重大提升。它还能进行二创、模拟电脑操作等。OpenAI发布由Sora 2驱动的社交APP,强调促进创作,保障安全。

AI进修生
推荐文章8

Python语言从2.7到3.14的能力变化与演进逻辑

文章从编程风格、类库生态、性能优化等多维,阐述Python从2.7到3.14版本的能力变化与演进逻辑。如编程风格现现代化转型,类库生态战略性调整,性能优化有突破性进展等,还分析了演进背后的推动力及未来趋势。

阿里云开发者
开源动态8

给机器人一个会预测未来的Critic,VLA强化学习直接起飞

OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。

机器之心
新闻资讯7

Anthropic 联创:2028 年实现 AI 自我构建的概率超过 60%

Anthropic 联合创始人 Jack Clark 发长文称,到 2028 年底,AI 实现端到端自动化研发概率超 60%。他分析多维测试数据,指出 AI 在代码、科研、自我训练和管理等方面能力提升,也探讨了成真后的影响,但遭黄仁勋和陶哲轩质疑。

AGI Hunt