手办图」共找到 530 篇相关文章

算法论文7

多模态模型挑战北京杭州地铁!o3成绩显著,但跟人类有差距

近年来,多模态大模型在多种场景取得进展,但能否‘看懂’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。

量子位
开源动态8

Google 把翻译能力彻底开源了!TranslateGemma:550种语言通吃,还能直接看翻译!

Google将多年积累的翻译能力灌进开源大模型TranslateGemma,它基于Gemma 3,专为翻译任务调优,有3个规模版本,覆盖550种语言,能直接看翻译,亮点颇多。

开源星探
新闻资讯7

独家|美入局 Visual Agent,Chance AI 完成数百万美元天使轮融资

布局下一代视觉 AI 入口,领投 Visual Agent 创业公司 Chance AI 数百万美元天使轮融资。该公司成立于 2025 年 8 月,从北美大学生切入,有独特产品逻辑,融资后将推进多方向发展。

Founder Park
新闻资讯8

梅卡曼德获豪华基石阵容认购:具身智能眼脑第一股即将挂牌|甲子光年

8月24日,梅卡曼德启动港股招股,拟9月1日挂牌。其为机器人提供眼脑组件,2025年全球市占率第一。业务增长快、海外收入过半,获豪华基石阵容认购,超八成募资将投向研发等。

甲子光年
开源动态8

AI 出为什么总很土?2100 星开源 Skill 用 244 行给了答案

AI出常显土气,开源项目`gc - minimal - zine - poster`用244行文档给出答案。它将日系zine感拆分为可执行指令,规定九个渲染问题,还给出取值区间和自检方法,能防止风格自我复制,且适配多种Agent。

AI Reading Hub
新闻资讯7

视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出仅需4秒

谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出快且便宜。二者串联使用,像生成与视频创作可无缝衔接。

量子位
新闻资讯7

伯牙智能创始人兼CEO刘欣:灵巧重塑具身智能|甲子引力X

2024年4月28日,「AI共潮生—2025甲子引力X科技产业新风向」大会举。伯牙智能CEO刘欣分享称,AI在物理世界赋能需灵巧,其操作发展尚处初期,有软硬件挑战,还提出对数据及触觉传感能力的新思考。

甲子光年
算法论文8

李飞飞 、 英伟达 Jim Fan 、徐丹飞三巨头联合重磅论文,改写灵巧触觉赛道

近日,李飞飞、英伟达Jim Fan等顶尖学者联合发表论文《T-Rex: Tactile-Reactive Dexterous Manipulation》。指出过去具身行业在灵巧触觉的探索方向可能错误,目前加触觉会让机器人变笨,但也给出解决方法,真机实测T-Rex表现优异。

AI科技评论
产品应用7

吉卜力风「游」爆火,可灵+Midjourney生成的!教程已出,支持复刻

吉卜力风格“游”在Reddit和推特爆火,它由AI制作,创作者用可灵AI、Midjourney结合文字提示实现效果,公开教程支持复刻。还介绍了制作方法及提示词示例,可灵AI发展势头也很猛。

量子位
算法论文8

DeepSeek又又又又发新论文了!这一次,他们重构了AI看的方式

DeepSeek发布论文DeepSeek - OCR 2,指出传统AI看方式有误,提出视觉因果流概念。其两阶段级联推理解法效果显著,还可能整合进即将发布的DeepSeek V4,有望实现原生多模态。

花叔