多参考图」共找到 4429 篇相关文章

新闻资讯7

谷歌深夜放出 IMO 金牌模型,项测试力压 Grok 4、OpenAI o3!网友评论两极分化

昨夜谷歌向 Google AI Ultra 订阅用户推 Deep Think 功能,Gemini 2.5 Deep Think 模型获 IMO 金牌。它是智能体模型,通过并行思维输出答案,在领域及测试中表现佳,但网友评价不一。

InfoQ
产品应用7

LibTV这个邪修功能,大大减少AI视频抽卡次数!

作者分享在LibTV用「深度动作捕捉」功能做AI视频,将视频动作提取成深度,可减少AI视频生成失败率,且不花积分,深度管几何,提示词管外观,提一次能用次。

花叔
开源动态8

Agentic Coding表现创新高,全新KAT系列模型强势霸榜SWE-Bench

快手 Kwaipilot 团队推出 KAT 系列两款 Agentic Coding 大模型,KAT - Dev - 32B 开源,KAT - Coder 闭源。两模型在 SWE - Bench Verified 表现出色,且在训练阶段创新优化,有强大代码生成能力和涌现现象。

机器之心
产品应用7

藏师傅教你用 Nano Banana 编辑片做手办

前几天发 Nano Banana 测评后,很人不知怎么用。刚好做手办玩法火了,作者教大家在 LM Arena 用 Nano Banana 编辑片、做手办,还介绍把片变视频及剪辑的方法。

歸藏的AI工具箱
算法论文8

ICML 2025 | 西湖大学吴泰霖研究员团队:组合生成式物理场元件PDE仿真

西湖大学吴泰霖课题组联合方提出“组合生成式物理场元件PDE仿真(M2PDE)”,将仿真问题视为生成式概率建模任务。该成果在任务测试中表现卓越,被ICML 2025接收。

力学与人工智能
开源动态8

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

过去两年视频生成模型不断提升画面参数,但传统模型生成的视频固定,用户无法干预。而世界模型可跟随操作实时渲染、动态生成世界。目前Noiz AI联合机构发布实时可交互音视频世界模型HelixWorld 1.0,后续还将开源。

量子位
算法论文8

WWW'26 | 跨任务自适应的Multi-Agent协作新范式

大型语言模型驱动的智能体系统成解决复杂任务重要范式,但智能体协作存在关键问题。Griffith和西北农林科技大学团队提出OFA - MAS,将智能体拓扑设计从one - for - one推向one - for - all,实验效果佳。

PaperAgent
开源动态8

准确率92.7%逼近Claude 3.5、成本降低86%,开源代码定位新神器LocAgent来了

OpenHands 等团队发布 LocAgent,这是用于代码定位的索引 LLM Agent 框架,准确率达 92.7%。它把代码库解析成,提供工具接口,经实验效果出色,开源微调模型降本增效,还能提升问题解决率。

机器之心
算法论文8

PixelRefer :让AI从“看大”走向“看懂每个对象”

模态大模型停留在整体场景级理解,现实任务需细粒度、对象级理解。浙江大学等联合提出PixelRefer框架,可实现精细视觉指代与推理,在项任务表现领先,轻量版性能优,还开源两类数据集。

机器之心
开源动态8

字节开源像生成“六边形战士”,一个模型搞定人物/主体/风格保持

字节UXO团队设计并开源统一框架USO,解决像生成指标一致性问题。它能统一看似孤立任务,实现单任务和组合任务的SOTA,弥补了主体保持和风格迁移短板,性能领先,还采用新范式及算法。

量子位