具身视觉」共找到 1606 篇相关文章

开源动态8

本周 5 个 YYDS 开源项目,真的很6!

本文推荐本周5个开源项目,有将命令行与图形化工集成的waveterm,能转换AI输出格式的PasteMD,总结Vibe coding的vibe - coding - cn,录屏剪辑工openscreen,还有年会抽奖系统log - lottery。

开源先锋
新闻资讯7

国产算力解决方案,如何赋能“AI for Science”?

AI已成驱动科研范式变革的核心力量,“AI for Science”成趋势。中科院陈刚分享AI赋能高能物理见解,还谈及国产算力方案应用表现,22家机构企业发起“科学智能联合攻关行动”。

芯师爷
产品应用7

刚刚,OpenAI推出全新ChatGPT Images,奥特曼亮出腹肌搞宣传

OpenAI推出全新ChatGPT Images,由新旗舰图像生成模型驱动,特性有精准编辑、保留细节等,图像生成速度提升4倍。该功能今日向多数用户开放,价格降20%,旨在让图像生成更简单。

机器之心
算法论文8

NeurIPS 2025|CAKE:大模型驱动的贝叶斯优化新配方,让黑箱优化更智能、更高效

香港中文大学(深圳)等高校研究人员提出 CAKE 方法,被 NeurIPS 2025 接收。它利用大语言模型动态设计高斯过程核函数,构建自适应贝叶斯优化框架,在多领域实验中效果优,还备可解释性。

机器之心
算法论文8

Thinking with Video:一种全新的思考范式

在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。

深度学习自然语言处理
算法论文7

视频模型假装在推理?MME-CoF新基准评估12个推理维度

视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。

新智元
开源动态8

一图胜千言被实现了!DeepSeek-OCR用图片压缩文本,10倍压缩率

DeepSeek开源DeepSeek - OCR,用图片压缩文本达10倍压缩率且几乎不丢信息。它解决了以往视觉编码器的问题,架构清晰,数据丰富,性能测试亮眼,为解决大模型‘记性差’问题提供新思路。

AIGC开放社区
新闻资讯8

2025乌镇峰会看点:人工智能,中国数字世界秩序之巅

2025年世界互联网大会乌镇峰会是战略转折点,议程、展览等聚焦AI,从宽泛论坛变为展示AI驱动发展模式平台。报告剖析议程架构、战略差异,评估其对全球AI格局等多方面的影响。

AI Reading Hub
新闻资讯7

辍学潮来了?19、20 岁年轻人“逃离”教室去 AI 创业,20 多年创业大佬断言:他们的机会比大厂大

云存储公司 Box 创始人 Aaron Levie 称,19、20 岁年轻人很多辍学投 AI 创业。他认为 AI 让初创公司生产力大幅提升,巨头优势不再,年轻创业者迎来黄金机会,还分享了创业建议。

AI前线
产品应用8

字节发了个机器人全能大模型,带队人李航

字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。

量子位