图像结构纹理」共找到 939 篇相关文章

产品应用7

实测惊艳全球的Veo3!音画同步无敌,贵是有原因的

谷歌开发者大会推出的Veo3模型,具备强大文本和图像转视频能力,首次实现视频与音频同步生成。实测中,它生成的视频音画效果惊艳,但也有翻车情况,谷歌还给出提示词编写指南。

机器之心
新闻资讯8

图灵奖得主杨立昆现场追问:AI 还没越过这 3 道认知墙,谈什么通用智能?

图灵奖得主杨立昆指出AI未越过三道认知墙,即看不懂物理世界、无长时记忆、无推理结构,提出JEPA架构及AMI概念,还建议别卷模型,应卷架构,如探索具身智能等领域。

力学与人工智能
推荐文章8

Pokee.ai 朱哲清:用 RL 搭建智能体的「骨骼与神经」| AI 产品十人谈

《AI 产品十人谈》对话 Pokee.ai 朱哲清,探讨强化学习与 Agent。朱哲清是强化学习信徒,曾带领 Meta 团队突围。他认为单靠预测难完成复杂任务,强化学习是超人类智能的关键,介绍了 Pokee.ai 产品优势及对通用 Agent 的看法。

AI科技评论
算法论文8

细节直逼亚毫米级!港科广分层建模突破3D人体生成|CVPR 2025

港科广团队提出MultiGO创新方案,借助分层建模思路突破3D人体生成难题。该方案通过三级几何学习框架提升重建质量,在多个测试集上性能领先,且在多领域有应用优势,研究成果入选CVPR 2025,项目代码将开源。

量子位
开源动态8

55.9K star!微软硬核开源文档转换神器,LLM最佳拍档!

介绍微软开源的轻量级Python文档转换工具MarkItDown,它支持20+格式智能转换为结构化Markdown,专为LLM文本分析场景优化,解决开发者处理多格式文档痛点,还阐述其功能、技术架构等内容。

小华同学ai
推荐文章8

我做内容产品的逻辑

作者黄益贺分享做内容产品的逻辑,认为真正好的内容产品应是证明系统,以“AI产业链投资”产品为例,介绍其认知、工具、实操三层结构,称这玩法难复制,是AI时代内容产品原型。

newtype AI
产品应用8

Meta首个Agent生图模型登场,空降竞技场第二

Meta超智能实验室推出图像生成模型Muse Image,引入智能体机制,能编写代码、网络搜索,有自主修正能力,支持算力扩展、多轮编辑与画面合成。还预览了Muse Video,两模型均与Meta产品深度整合。

AI寒武纪
产品应用8

verify-data:一个端到端的数据验数 Agent Skill

本文介绍端到端数据验证 Agent Skill——verify-data,它能自动完成从表结构获取到报告发布全流程,将传统手工验数升级。文章从多方面展开介绍,还给出未来演进方向,为开发者提供参考。

阿里云开发者
新闻资讯8

Altman 亲自坐镇发布 ChatGPT Image 2,小编实测:风格、画质、叙事感全都夯爆了

OpenAI CEO Sam Altman 亲自发布 ChatGPT Images 2.0,这是该公司迄今功能最强的图像生成模型。它有思考能力,可直出 8 张连贯图片,支持多语言、多种画幅与分辨率,能精准执行复杂指令,直接商用也没问题。

InfoQ
产品应用8

从Vibe Coding到Agentic Engineering:重构后台开发全流程

文章介绍从 Vibe Coding 到 Agentic Engineering 的转变,以真实需求为例,展示后台开发全流程,涵盖需求获取到合入发布各阶段,介绍各阶段工具及操作,凸显 Agentic Engineering 优势,强调人编排、AI 执行的核心理念。

腾讯技术工程