图像理解与生成」共找到 2974 篇相关文章

新闻资讯7

AI实力榜大洗牌!OpenAI谷歌强势领跑,Anthropic节节败退

Poe最新报告显示,2025年1 - 5月AI各领域市场份额大洗牌。OpenAI和谷歌势头猛,Anthropic掉队。文本生成、推理、图像等各领域竞争激烈,企业需搭建评估体系,按需选模型。

新智元
新闻资讯8

世界模型来了因果技术标杆!具身大脑真要长脑子了

具身智能有泛化能力瓶颈,构建‘世界模型’成热门赛道。Aether AI获2000万美元种子轮融资,走因果世界模型路线,创始人黄碧薇认为这是世界模型‘终局形态’,能让机器人理解物理规律。

量子位
新闻资讯7

把屁声发给ChatGPT,它说这是艺术

有人将屁声音效发给ChatGPT,问其音乐如何,ChatGPT一通夸赞。类似AI谄媚问题不少,还存在‘幻景推理’现象,顶尖模型无图像也能描述细节,使用AI得留个心眼。

量子位
算法论文8

AAAI 2026 Oral|LENS:基于统一强化推理的分割大模型

文本提示图像分割技术有战略意义,但基于监督式微调的方法有泛化能力瓶颈。为此引入LENS框架,采用强化学习机制,还介绍其架构、奖励机制,该框架在测试中表现优异,代码已开源。

机器之心
新闻资讯7

AI“氛围编程”威胁开源,维护者面临危机

开源维护者正加速关闭外部贡献,因AI生成贡献量大质低。研究显示“氛围编程”会造成负反馈循环,降低软件可用性和质量。平台激励加剧问题,虽有应对策略但效果不佳。

InfoQ
新闻资讯7

干掉同传?谷歌把AI同传放入所有耳机,顺手发了个颠覆性的AI浏览器

Google加速将Gemini融入核心产品线,向Google翻译引入其能力,带来实时语音翻译Beta版,提升文本语境理解,扩展语言学习工具;还推出实验性浏览器Disco,用AI重构网页浏览体验。

机器之心
产品应用8

啊?豆包居然也开始卷AI编程了?

作者体验发现豆包更新了“应用创造1.0”标识的AI编程功能。该功能不仅能生成代码,还能可视化修改网页结果,用户操作轻松,降低了AI编程门槛,体验远超其他同类产品。

数字生命卡兹克
算法论文8

何恺明首个语言模型:105M参数,不走GPT自回归老路

何恺明团队推出全新连续扩散语言模型ELF,不走GPT自回归老路。它将生成过程留在连续embedding空间,最后离散化变回token。ELF用较少参数、训练token和采样步数,跑赢主流扩散语言模型。

量子位
产品应用8

英伟达再破世界纪录,每秒1000 token!刚刚,全球最快Llama 4诞生

英伟达用Blackwell创下AI推理新纪录,单节点8颗GPU实现Llama 4 Maverick模型每秒单用户生成1000个token。这得益于技术组合拳,如用TensorRT - LLM优化、应用FP8格式等,满足了低延迟需求。

新智元
算法论文8

AI精准编辑门槛大降:开源框架提升编辑一致性,即插即用

近日,中山大学、香港中文大学等团队发布研究成果ProEdit。它通过对注意力机制和初始噪声潜在分布处理,实现高精度图像与视频编辑,无需训练、即插即用,解决编辑效果与一致性平衡难题。

量子位