交错式生成」共找到 2572 篇相关文章

产品应用7

AI又来带货了!字节推出DreamActor-H1自动对齐手势和商品

在电商和数字营销领域,现有框架呈现效果不佳。字节推出DreamActor - H1框架,基于扩散变换器,集成Seaweed - 7B模型,能生成高保真人机交互视频,有效果突破但也存在局限。

带你学AI
新闻资讯8

Scaling没有墙!Anthropic CEO:AI实验室真相远超公众想象

Anthropic CEO Dario Amodei在摩根士丹利会议称Scaling Law未撞墙,2026年将激进加速。他用棋盘稻米寓言比喻,称当前处第40格,前39格增长只是前奏。还透露代码生成是AI能力爆发指标,Anthropic或在RSI取得进展,且重视人才文化。

新智元
产品应用7

AI视频运镜玄学已破!告别无限抽卡,3D预演台直接封神

用AI做视频常遇运镜、人物走位等问题,因文生视频系统缺空间锚定能力。updream在8月17日上线「预演台」功能,通过传参考图自动生成3D白模场景,实测显示其显著减少「抽卡」次数。

新智元
新闻资讯7

DoorDash 如何打造了一款不完全依赖大型语言模型(LLM)的 AI 购物助手

DoorDash 分享对话 AI 助手 Ask DoorDash 的架构,它借助 LLM、AI 代理等构建系统。测试显示其提升了结账转化率等指标,还构建自动评估框架改进质量衡量,架构分离协调与业务功能。

InfoQ
产品应用8

阿里又放大招!一句话,造一个能走进去的世界

阿里上线HappyOyster 1.0世界模型,一句话生成可实时探索、交互的开放世界。它与文生视频不同,能让用户参与体验。该模型有世界探索和实时导演两大功能,技术优势显著,应用场景广泛。

新智元
算法论文8

只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026

多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。

量子位
开源动态8

170次搜索+50次反思:用GLM-4.7盘点2025 Agent行业趋势,结果太震撼!

作者给智谱新开源的GLM - 4.7布置调研2025年Agent赛道企业的任务,结果令人震撼。该模型进化显著,能整理详细企业信息,还能生成高审美PPT。国内有不少特色AI落地企业。

探索AGI
新闻资讯7

腾讯胡文博:引领 3D 视频世界模型新趋势丨GAIR 2025

2025年12月12 - 13日,第八届GAIR全球人工智能与机器人大会将在深圳举办。腾讯ARC实验室高级研究员胡文博将在13日《世界模型》论坛分享《迈向三维感知的视频世界模型》。他深耕视频生成模型,成果显著。

AI科技评论
产品应用7

Deepseek 正发布 V3.1:混合推理,Agent能力大幅提高,token消耗减半

Deepseek正发布Deepseek V3.1,采用混合推理,支持双模切换,上下文扩展到128k,API支持Claude Code调用。工具与Agent能力提升,思考效率更高,token消耗减半,官方渠道全面升级,9月6号起调整价格。

AI寒武纪
产品应用7

AI开始学会合作?!实测4大多Agent体=10个打工人

Agent热潮进入多智能体时代,多款产品涌现。鲸哥测评了它们在商业计划、运营设计等四大场景表现,总结各产品亮点与不足,指出多Agent正推动大模型向“协作智能群体”演进。

鲸选AI