「图像分层生成」共找到 2545 篇相关文章
刚刚,英伟达拟10亿美元砸向这家AI编码创企!Copilot 技术大佬带队、成立两年估值近千亿
10月30日消息,英伟达拟向AI初创公司Poolside投资最高10亿美元。该公司由微软技术大佬带队,定位生成式AI与软件开发交叉领域,开发自研模型,有独特强化学习方法和技术布局。
CapRL:用强化学习突破Image Captioning训练瓶颈,3B模型性能媲美72B
上海人工智能实验室联合团队发布 CapRL,首个将 DeepSeek - R1 强化学习策略用于 Image Captioning。CapRL - 3B 模型在图像描述任务媲美 Qwen2.5 - VL - 72B,已开源,团队持续迭代优化。
国产开源LLM大爆发,Qwen、Minimax、美团、腾讯~
近期国产开源LLM大爆发,Qwen3-VL家族新增模型,有技术亮点且可免费商用;MiniMax-M2为编码和代理任务打造;美团LongCat-Video、LongCat-Audio-Codec各有专长;腾讯混元世界 - 镜像用于3D几何预测。
SIGGRAPH Asia 2025|电影级运镜一键克隆!港中文&快手可灵团队发布CamCloneMaster
香港中文大学与快手可灵团队联合提出运镜可控视频生成框架CamCloneMaster,引入‘参考即用’范式,告别对相机参数依赖。其训练、测试代码和数据集均已开源,在各项指标上优于SOTA方法。
前Meta大神创业,用强化学习打造PokeeResearch-7B模型,刷新AI深度研究SOTA
Pokee AI发论文介绍70亿参数的PokeeResearch - 7B模型,用基于AI反馈的强化学习和推理框架,在深度研究基准测试中成绩领先。该公司由前Meta大神创立,产品可打通多应用,已获融资并公开测试。
刚刚,Anthropic 发布 Claude for Life Sciences,目标生物科研全流程
Anthropic推出Claude for Life Sciences,全方位布局生命科学领域。它配备Skills功能,生物学测试表现提升,能解读图像、分析数据。还深度整合科研生态,应用场景广,获众多药企、学术机构青睐,还有AI for Science计划。
AI画手总是六根手指?阿大/美团/上交首次系统量化扩散模型计数幻觉
阿德莱德大学、美团和上海交通大学团队首次系统研究扩散模型“计数幻觉”问题。构建CountHalluSet数据集套件量化该问题,揭示其与采样条件的关系,还提出JDM模型缓解计数幻觉。
从混沌到可控:企业应用中AI Agent不确定性控制的 10 种策略
大语言模型输出的不确定性限制了AI智能体在企业场景的应用,本文总结控制生成式AI Agent不确定性的常见策略,涉及技术、应用设计、管理与治理层面,还推荐了相关作品。
苹果传统强项再发力,视觉领域三种模态终于统一
苹果在大模型领域常受挫,但计算机视觉研究是其强项。其研究团队提出 ATOKEN,这是首个能在主要视觉模态统一处理的分词器,兼顾重建质量与语义理解,成果朝通用视觉表征迈进一步。
MultiAgent架构实践:如何打造GitHub Stars 2.8k的ComfyUI-Copilot V2.0
ComfyUI是Stable Diffusion生态中可视化编程工具,但使用有难度。ComfyUI - Copilot V2.0基于多智能体协作框架构建,能实现对话开发、报错修复等功能,还介绍了其架构、技术栈及多智能体设计思路等。