图像生成评估」共找到 2990 篇相关文章

算法论文7

大模型在具身推理上「翻车」了?4496 道题全面揭示短板

美国东北大学等提出BEAR基准评估MLLM具身智能子能力,用4496道题测试20个模型。发现多模态大模型具身能力不足,还分析错因,开发BEAR - Agent提升模型具身推理能力,在仿真测试中效果显著。

机器之心
算法论文7

VaseVQA:考古领域实现专家级,诊断+补弱RL框架

在文化遗产与人工智能交叉领域,研究人员提出把大型多模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。

新智元
算法论文8

基础模型已颠覆科研,进入第五范式!港科大综述113篇论文 | NeurIPS'25

港科大论文指出,随着科学问题复杂度提升,传统科研范式显露出局限。基础模型(FMs)横空出世,具备通用性、规模与知识覆盖、推理与生成能力,可能引领科学进入第五范式,但也面临偏见、幻觉等问题。

新智元
开源动态8

刚刚,Andrej Karpathy放出大招:开源nanochat项目,仅8000行代码100美元就能训练出一个ChatGPT

Andrej Karpathy发布nanochat项目,用8000行代码实现ChatGPT完整训练流程。在8xH100节点跑4小时、花100美元,就能有对话、写故事、答题的AI助手。项目覆盖广,含多训练步骤及评估体系。

AGI Hunt
产品应用7

产品经理也能“开发”需求?淘宝信息流从需求到上线的AI端到端实践

淘宝推荐信息流业务被“需求多、技术栈杂、协作慢”困扰,上线周期长。WaterFlow这一AI驱动的端到端开发实践,让部分需求两天内上线,产品经理也能参与。文章揭秘其落地及协作模式改变,还展示了实践效果。

阿里云开发者
新闻资讯7

首位AI女演员出道!好莱坞「天敌」来了,下一代偶像全是代码制造?

9月底苏黎世电影节上,AI制作公司Particle6打造的AI女演员Tilly Norwood亮相引热议。这意味着AI视频生成技术正加速渗透影视行业,也引发了关于AI演员是否会取代人类演员等诸多争议。

新智元
产品应用8

字节Seed发布PXDesign:蛋白设计效率提升十倍,进入实用新阶段

字节跳动Seed团队提出可扩展蛋白设计方法PXDesign,24小时生成数百高质量候选蛋白,效率较主流方法提升约10倍,湿实验成功率达20%–73%。还推出公开免费在线服务,提供配套工具加速应用落地。

量子位
算法论文8

让RAG真正读懂“言外之意”!新框架引入词汇多样性,刷新多项基准SOTA

ACL 2025研究提出Lexical Diversity - aware RAG (DRAG) 框架,将词汇多样性引入RAG检索与生成,解决现有方法痛点。它有两大创新模块,实验在多基准提升准确率,还将在多模型上增益,代码即将开源。

量子位
新闻资讯8

一次汇报,资源投入暴涨数十倍:快手大模型推荐以 1/12 成本突围,技术负责人亲历的革新故事

InfoQ 专访快手科技副总裁周国睿,他分享了快手大模型推荐技术投入挑战、决策过程等。如汇报后资源投入涨数十倍,以 1/12 成本突围。还阐述推荐系统变革、技术押注及未来推荐系统突破点等观点。

InfoQ
推荐文章7

CEO 上阵写代码,公司从被传濒临倒闭到千亿估值,最大功臣是Claude?

Airtable创始人兼CEO Howie Liu分享公司发展。Airtable曾被传濒临倒闭,后年收入达数亿美元。他亲自参与编程,围绕AI重组公司,还介绍推动团队用AI、岗位转型及公司转型AI的策略,强调打破角色壁垒。

InfoQ