高分辨率图像感知」共找到 792 篇相关文章

新闻资讯7

劈柴哥玩得上头!Nano Banana Pro 真杀疯了,但谷歌没接住用户的付费热情?

谷歌推出新图像生成与编辑模型 Nano Banana Pro,它基于 Gemini 3 Pro,能力提升,获大量好评。不过付费流程繁琐遭吐槽。此外,谷歌 CEO 回应了 AI 泡沫、岗位影响等问题。

AI前线
推荐文章7

评论送书 | Al智能体与传统AI应用的区别?它如何工作?如何快速构建智能体?

文章对比AI智能体与传统AI应用,指出前者更像“乐高积木”,可融入生活工作。介绍其工作是“感知—推理—执行—学习”循环,还给出快速构建通用方法,如明确目标、选框架等。

AIGC开放社区
算法论文8

Anthropic:大模型开始意识到自己在想什么!

Anthropic的Jack Lindsey论文《Emergent Introspective Awareness in Large Language Models》对大模型做神经科学受控实验。发现Claude Opus 4/4.1能感知内部念头,区分内外状态,通过检查内部状态一致性判断输出意图。

深度学习自然语言处理
新闻资讯8

北大校友Lilian Weng出镜,爆出120亿估值首个交互模型!

北大校友Lilian Weng出镜介绍Thinking Machines的交互模型,此模型200毫秒神同步,能感知协作。该公司此前获20亿美元种子轮融资,估值达120亿美元。模型打破传统交互局限,或改变人机互动方式。

新智元
算法论文8

一键开关灯!谷歌用扩散模型,将电影级光影控制玩到极致

Google推出LightLab项目,可从单张图像精准控制光影,解决传统光影控制难题。其通过特殊数据集微调扩散模型,让模型学会控制光照,还介绍了方法、后处理流程等,实验显示表现优,有多种应用。

机器之心
产品应用7

Omni-Effects:首个统一多特效生成框架

Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。

带你学AI
推荐文章8

拼交付、主动找活干,3 月我们推荐这 18 款 Agent 产品

3月是AI产品发布密集期,出现一批主动干活的Agent产品。文章介绍18款产品,如Claude系列升级为个人AI操作系统,OpenClaw生态涌现多种商业形态,还有垂直场景Agent及上下文感知等产品。

Founder Park
开源动态8

2.1K Star!这个 Claude Skills 技能库,给 AI 编程助手装上了 66 颗专家大脑!

GitHub上的开源项目claude - skills迅速走红,斩获2.1K Star。它是全能技能注入包,内置66种专业技能,覆盖12个领域,有300多份深度参考文档,具备上下文感知能力,还整合9套工作流,安装方式多样。

开源星探
算法论文8

基于DINOv2和SAM2改进的U-Net模型

DSU-Net是基于DINOv2和SAM2改进的U-Net模型,通过多尺度跨模型特征协作和轻量级适配器模块,解决现有图像分割模型在特定下游任务表现不足问题,提升分割精度,降低训练成本。

机器学习AI算法工程
算法论文8

谢赛宁新作:VAE退役,RAE当立

谢赛宁团队研究表明VAE时代结束,RAE将接力。RAE是用于扩散Transformer训练的新型自动编码器,能提供高质量重建结果,有语义丰富潜空间,支持可扩展架构,收敛快,在ImageNet图像生成效果强劲。

量子位