文本到 3D 生成」共找到 4262 篇相关文章

产品应用8

手撕Sora,脚踢Veo!13个行业实战案例,Seedance 2.0玩法大全

本文是藏师傅对 Seedance 2.0 的测评和教学,介绍其 API 春节后将上线火山引擎,支持全模态输入。通过 13 个行业实战案例展示该模型能力,如生成广告、宣传片、教学视频等,还提及 Agent 自动化应用。

歸藏的AI工具箱
推荐文章7

下一代搜索:通过 MCP 实现 AI 与 OpenSearch 的融合

本文探讨 MCP 如何在 AI 代理和 OpenSearch 间建桥梁,创建智能搜索应用。介绍搜索从关键词代理的演变,还通过电商、可观测性等场景演示代理搜索实践,显示 MCP 与 OpenSearch 结合能带来上下文感知的智能数据访问体验。

InfoQ
产品应用7

Claude写完代码不直接交了:4个Skill自查一遍,改好再找你

Anthropic将AI验收纳入循环,让Claude写完代码后进行四道检查才交付,定义了验证循环,Claude Code团队有4个自查Skill,还介绍了写验证Skill的方法、触发设置,AI编程竞争正从生成转向验证。

新智元
新闻资讯8

Claude Design连夜突袭,Figma市值瞬间蒸发!或抢走全球UI设计师饭碗

Claude实验室推出Claude Design功能,只需输入一句话就能生成可交互完整原型,让Figma等设计公司股价跳水。它或让画图动作消失,引发对设计师职业是否会被取代的思考,Anthropic还在下更大的棋。

新智元
算法论文8

Pipeline MinerU真快不行了

文章聚焦Infinity-Parser,指出它把OCR从‘做识别’推进‘做结构’。它采用layoutRL强化学习框架,结合真实与合成数据构建Infinity-Doc。跑分强且复杂结构表现优,透露Document AI向结构化生成转变趋势。

CourseAI
算法论文8

CVPR2026 | Streamo:让大模型变成实时流式交互助手

香港浸会大学联合腾讯优图实验室提出 Streamo,将‘何时回答’变为模型预测的 token,通过端端训练框架把离线视频模型转化为实时流视频助手,还构建 Streamo - Instruct - 465K 数据集,实验效果良好。

机器之心
算法论文8

真·开外挂!MIT新研究:架构0改动,让大模型解锁千万级上下文

MIT CSAIL团队提出递归语言模型RLM,不改动模型架构,让GPT - 5、Qwen - 3等模型具备千万级token超长文本处理能力。它将上下文处理“外包”,实验显示其处理规模超前沿模型,复杂任务优势显著,多数场景性价比高。

量子位
算法论文8

大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力

空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。

量子位
产品应用7

实测完“灵光”,我意识人类对 AI 助手的开发不足1%

作者实测蚂蚁集团的AI应用「灵光」,它是面向普通人的零门槛全模态AI助手,能30秒生成可互动小应用。作者测试其三大功能,认为人类对它的开发不足1%,它或成探索世界的伙伴。

AI科技评论
算法论文8

训练成本暴降99%,35秒出1分钟高清视频!英伟达MIT等引爆视频AI革命

英伟达联合MIT、港大团队提出SANA - Video架构,其核心是创新的全局线性注意力Diffusion Transformer训练框架和全局显存恒定的KV缓存机制。它训练成本低、速度快、可部署,重新定义AI视频生成效率极限。

新智元