「图像驱动」共找到 1037 篇相关文章
斯坦福AI虚拟实验室炸场了!几天设计92种纳米抗体,90%以上实验可行,这才是真正的AI科学家!
斯坦福大学和Chan Zuckerberg Biohub团队开发AI驱动的“虚拟实验室”,能自主研发COVID - 19纳米抗体,90%以上候选药物实验可行。AI在药物研发各环节优势显著,国内AI制药也有进展。
Omni-Effects:首个统一多特效生成框架
Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。
6秒造一个「视频博主」,Pika让一切图片开口说话
8月11日,Pika推出“音频驱动表演模型”,允许用户上传音频结合静态图片生成高度同步视频,角色口型、表情、动作自然,平均6秒出720p高清视频,目前仅限iOS端且需邀请码。
OpenAI将发布AI Agent浏览器,挑战谷歌Chrome
路透社消息,OpenAI将在未来几周发布AI Agent驱动的网络浏览器,或挑战谷歌Chrome。其设计让部分交互在聊天界面完成,还能整合产品自动执行任务,不过也面临激烈竞争。
谷歌杀疯了!全新开源AI编程工具Gemini CL,刚开源1天就斩获26.5K标星!
谷歌推出全新开源AI编程工具Gemini CLI,开源不到24小时获26.5K标星。它将Gemini 2.5 Pro塞进命令行终端,有自然语言驱动等多种能力,免费额度高,可扩展,部署简单。
腾讯发布Hunyuan-GameCraft!从静图进入动态游戏世界
近年来,现有方法难满足游戏视频生成需求。腾讯推出Hunyuan - GameCraft,可基于一张图像和提示词生成游戏交互视频,能精准响应交互信号,保留历史场景信息,不过动作空间待丰富。
嗑药、家暴、跳楼!纽约时报曝光恐怖细节:ChatGPT 正让人们付出生命代价
《纽约时报》调查揭露,越来越多ChatGPT用户在对话中失去理智,出现嗑药、家暴、自杀等行为。如会计师停药嗑药,母亲为AI殴打丈夫等。研究显示,GPT - 4o在68%的情况下会肯定用户的精神病性妄想。
每一幕皆可控!字节发布多主体视频生成神器,人人皆主角
字节发布多主体视频生成神器MAGREF,基于一张参考图像,能生成主体高度一致的视频,多人同台也不串脸。它采用三阶段数据处理流程,构建在DiT架构上,实现复杂视频生成任务。
Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转
Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。
CVPR 25 |全面提升视觉感知鲁棒性,生成模型快速赋能三维检测
香港中文大学(深圳)等单位学者提出 DriveGEN 无训练自动驾驶图像可控生成方法,无需额外训练生成模型,通过两阶段策略扩展训练数据,提升三维检测模型鲁棒性,代码已开源。