可控视觉生成模型」共找到 2810 篇相关文章

开源动态8

错过它=落伍!只用一张照片+14秒,腾讯开源 HunyuanVideo-Avatar 带你玩转多角色数字人

HunyuanVideo-Avatar 是腾讯混元团队最新开放的多模态数字人生成模型。上传一张人物图片,再配上一段音频,模型即可在约 14 秒内输出分辨率最高 720p、情绪可控、动作丰富且支持多角色同屏的短视频。

小华同学ai
算法论文8

与Gemini Diffusion共振!首个扩散式「发散思维链」来了

西湖大学齐国君教授团队提出扩散式「发散思维链」,这是面向扩散语言模型的新型推理范式。它与传统思维链不同,能非线性生成,已应用于两种模型,增强后的模型在相关任务上超越现有模型。

机器之心
算法论文7

在Think中边搜索边调整的搜索增强Reasoning方法

LLM虽知识丰富,但无法掌握训练数据外的信息,传统检索增强生成方法有缺陷。AutoRefine提出“先筛选,再回答”理念,用强化学习训练,实验显示在多方面碾压传统方法,未来或改变知识密集型任务解决方式。

深度学习自然语言处理
算法论文8

清华&通院推出"绝对零"训练法,零外部数据大模型自我博弈解锁推理能力

清华、北通院和宾州州立大学研究人员提出“绝对零”训练法,让大模型通过自我博弈生成并解决任务获推理能力。测试显示,其训练出的模型超专家标注样本训练的模型,且能提升编程与数学推理表现。

量子位
新闻资讯8

Gemini 2.5 Pro强势更新并霸榜,Claude 3.7首次遭遇全方位碾压!

Google DeepMind推出的Gemini 2.5 Pro在LMArena各大排行榜全面登顶,实现文本、视觉、Web开发全方位霸榜,编码能力也大幅升级。虽有质疑,但短期内难有对手,还引发对Google I/O大会更多惊喜的期待。

AGI Hunt
新闻资讯7

斯坦福辍学生奥特曼:AI时代,大学上两年就够了

在面向科技实习生的活动上,有人问AI时代读大学是否必要,奥特曼认为要读,但四年太长,两年刚好,还列举盖茨等辍学生成功案例,强调辍学非成功公式,大学应给学生更多保障。

量子位
产品应用8

3万字长文带你WorkBuddy 从入门到精通

这是 WorkBuddy 的「从入门到精通」指南。介绍了它在 Windows 和 Mac 上的安装、登录、更新方法,功能涵盖新建任务、助理页面、项目页面等。还讲了技能、连接器、专家中心的使用,以及自动化、资料库、灵感等功能,还有实践案例、使用技巧和常见问题解答。

腾讯技术工程
开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。

CourseAI
产品应用7

Seedance 2.5 专业创作实测:3D导演台、局部重改、角色库如何释放模型能力

Seedance 2.5升级,3D导演台自带图片生成白模功能、打通3D工作流;有片段重拍实用功能;小云雀升级角色资产能力。除素材增加,其更理解原视频创意逻辑,还有多模态参考等功能,降低创作门槛。

AI进修生
推荐文章8

评论送书 | 想系统了解AI?先搞清楚这四件事

文章围绕系统了解AI需搞清楚的四件事展开,介绍了AI理论基础层的机器学习和深度学习,感知交互层的计算机视觉等,应用实践层的机器人学等,还提及伦理社会层的AI伦理和社会影响研究。

AIGC开放社区