推理潜力」共找到 2401 篇相关文章

产品应用7

Omni-Effects:首个统一多特效生成框架

Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。

带你学AI
产品应用8

6秒造一个「视频博主」,Pika让一切图片开口说话

8月11日,Pika推出“音频驱动表演模型”,允许用户上传音频结合静态图片生成高度同步视频,角色口型、表情、动作自然,平均6秒出720p高清视频,目前仅限iOS端且需邀请码。

机器之心
算法论文8

自回归模型杀回图像生成!实现像素级精准控制,比Diffusion更高效可控

当下AI图像生成领域,Diffusion模型虽为主流,但在精准控制上有不足。伊利诺伊大学香槟分校等机构研究者提出MENTOR框架,用自回归模型实现像素级精准控制,比Diffusion更高效可控。

量子位
新闻资讯7

李开复入场Agent!零一万物推出“万仔”,直接对话CEO走独特“一把手工程打法”

今早,李开复宣布零一万物升级万智平台2.0并推出企业级Agent智能体。他指出AI Agent正重构企业架构,零一万物采用“一把手工程打法”,万智2.0有五大功能,还预计了AI Agent三个演进层级。

量子位
新闻资讯8

全球首个IMO金牌AI诞生!谷歌Gemini碾碎奥数神话,拿下35分震惊裁判

谷歌DeepMind官宣Gemini Deep Think在IMO获官方认证金牌,4.5小时解5题得35分。它用纯英语解题,结合并行思考与强化学习训练。谷歌后续将向部分测试者及订阅者推出模型,还公开了解题过程。

新智元
开源动态8

告别评估乱象!首个视觉解释综合性基准发布,附人类真值 | KDD'25

埃默里大学团队推出首个视觉解释基准Saliency - Bench,构建8个任务的数据集,提供标准化评估流程与开源工具包,解决评估缺乏标准等问题,推动可解释AI向可靠、透明发展。

新智元
新闻资讯7

包云岗:不止步于原位替代ARM,开源是RISC-V破局的关键

在全球半导体产业格局重构背景下,RISC-V从边缘走向核心。第五届RISC-V中国峰会举办,包云岗分享其产业应用观察。虽前景好,但RISC-V面临诸多问题,他认为开源是破局关键,还介绍了降成本案例和香山项目。

芯师爷
算法论文8

ICML2025|宁波东方理工大学刘野,陈云天:DragSolver:用于真实汽车风阻系数估计的多尺度Transformer方法

当汽车高速行驶,空气阻力影响车辆性能。传统风阻系数测算方法耗时久,难以满足实际需求。宁波东方理工大学等机构研究者提出DragSolver模型,能快速准确估计风阻系数,经实验验证效果优,有降本增效等价值。

力学与人工智能
新闻资讯7

Gemini 2.5 Pro 负责人:最强百万上下文,做好了能解锁很多应用场景

谷歌DeepMind长上下文预训练联合负责人Nikolay Savinov在播客中分享Gemini 2.5长上下文技术。他认为长上下文能革新产品交互,与RAG协同,未来千万级token上下文将成标配,但当前百万级未达完美时扩规模意义不大。

Founder Park
开源动态8

GitHub 1.3k 一款能“填色回忆”的神器:DDColor 让老照片鲜活又逼真

DDColor是阿里达摩院团队提出的新一代图像自动着色模型,基于双重设计,能实现高保真、真实感强的黑白图转彩色图。它兼容多种类型图片,有诸多核心功能,相比传统模型优势明显,应用场景广泛。

小华同学ai