「多模态生成与理解统一」共找到 3463 篇相关文章
谷歌发布最强 AI“全家桶”、一句话就让AI拍大片!这一夜,谷歌Gemini贯穿始终,网友:果然Android“靠边站”了
谷歌在I/O大会推出AI“全家桶”,含Gemini 2.5模型更新、搜索新AI模式等。谷歌已发布十多个新模型、20多个重大AI产品与功能,多项数据显示AI发展迅速,还有多项目融入产品,多模态模型升级。
和Anthropic CEO一起发过Nature,他用Claude Code复活三年烂尾代码
华盛顿大学首席开发者Brendan MacLean用Claude Code复活三年烂尾代码。他像带实习生一样带Claude,构建上下文让其理解代码库。同一周OpenAI开源Symphony,实现任务自动派Agent。二者路线不同但目的相同,都在探索让AI融入工程流程。
300个AI员工,跑满4000步不崩,Kimi新一代模型K2.6来了
月之暗面开源发布 Kimi K2.6 模型,在通用智能体、代码编写和视觉理解等综合能力上全面跃升。它在多项测试成绩领先,能连续工作13小时,还在全栈开发、多智能体协作等方面有出色表现。
浏览器自动化:从GUI到OpenCLI
文章讲述放弃不稳定的前端UI自动化操作,采用解析并复现底层API请求的方式,来解决浏览器自动化的效率与稳定性难题。介绍了OpenCLI思路、使用方法、原理,还提及自动生成CLI及应用案例,指出未来软件竞争维度将转向可调用性。
4步生图封神,GenEval从61%狂拉到92%,全面超越GPT-4o的TDM-R1模型来了
香港科技大学唐靖团队等提出全新通用强化学习框架 TDM - R1,仅 4 步采样就让组合式生成指标 GenEval 从 61% 升至 92%,超越 GPT - 4o。它解决少步扩散模型痛点,实现多方面性能提升,为少步生图发展带来新方向。
Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一到一个向量空间
Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射到同一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。
飞书合作的第一款AI硬件来了,居然是个AI录音豆。
飞书与安克创新合作推出首款AI硬件——AI录音豆。该产品小巧便携,可夹在衣服或吸附金属上,有飞书生态,录音质量好,自带底噪抑制,录音后能自动同步云端,快速生成会议纪要,还支持实时翻译。
关于 AI Agent,你最想知道的 3 个问题——为什么我说“垂直 Agent”是个伪命题
文章解答了关于 AI Agent 的三个读者问题,包括概念定义、大厂推出的原因及商业化前景、通用与垂直类 Agent 的商业前景。指出 Agent 是 AI 落地有价值方向,目前有挑战,真正机会在围绕其构建的数据、工具和行业理解。
开源8300小时标注数据,新一代实时通用游戏AI Pixel2Play发布
随着AI在代码和图片生成领域成熟,研究人员开始关注其在游戏领域的表现。此前的专用模型缺乏跨游戏泛化能力,通用模型在游戏环境中表现不佳。为此,Player2研究员提出Pixel2Play模型,还开源了代码和数据集。
黄仁勋CES最新演讲:Rubin 今年上市,计算能力是 Blackwell 5 倍、Cursor 彻底改变英伟达软件开发方式、开源模型落后于先进模型约6个月
英伟达CEO黄仁勋在CES 2026演讲宣告AI从理解语言走向改造物理世界。他提及开源模型发展,还发布多款新品,如AlpaSim仿真框架、GROOT 1.6机器人模型、AI超算Vera Rubin等,凸显英伟达在AI领域的布局与野心。