「端到端生成」共找到 4157 篇相关文章
从Sora2到TapNow:AI视频创作,差的是这套专业流程
国内知名导演欧阳英豪用AI打造百万级商业TVC,TapNow公开其创作流程。当下AI视频工具强,但能用于商业的TVC少,核心问题是不懂专业流程。TapNow将专业流程工具化,有五大核心功能,适合不同层次创作者。
从扫街榜到Robotaxi,空间智能彻底打开了高德的想象空间
这周一,一张神秘海报引发对高德的猜测。11月5日,高德宣布与小鹏合作提供Robotaxi服务。其空间智能形成闭环,比语言模型更接近AGI,还能为Robotaxi提供安全保证,且在多领域有落地应用。
AI版盗梦空间?Claude竟能察觉到自己被注入概念了
Anthropic最新研究发现LLM有内省迹象,Claude能察觉概念注入。研究用概念注入测试,虽模型内省能力有限且不可靠,但能力强的Claude Opus 4和4.1表现好,未来内省或更复杂。
DeepSeek-OCR生态爆发!从前端到跨平台,解锁OCR新玩法!
近年来OCR技术应用广泛,DeepSeek-OCR开源后引发开发者关注。文章盘点其四个衍生项目,有轻量级前端应用、Windows桌面应用、全Rust跨平台客户端和专业PDF转换工具,覆盖多场景。
大模型推理学习新范式!ExGRPO框架:从盲目刷题到聪明复盘
上海人工智能实验室等团队提出经验管理和学习框架ExGRPO,能科学管理经验。与传统RLVR方法比,它在不同基准提升性能,尤其复杂推理任务,还揭示滚雪球效应,为模型推理训练提供新思路。
“谈故障色变”到有章可循:美图 SRE 故障应急与复盘实践
在 InfoQ 举办的 QCon 全球软件开发大会上,美图高级运维经理石鹏分享美图 SRE 团队故障应急与复盘实践,探讨故障应急各环节,剖析故障本质与原因,还交流 AIOps、LLM Ops 等技术。
从6人日到1人日:一次AI驱动的客户端需求开发实战
文章分享AI驱动客户端需求开发实战,从实践活动汇总AI Coding问题,给出解决建议。以穿搭动态框架需求为例展示开发过程,对比效率提升300%,还探讨需求拆分、Prompt编写等问题,介绍业务开发范式。
从Transformer到GPT-5,听听OpenAI科学家 Lukasz 的“大模型第一性思考”
2017年《Attention Is All You Need》提出Transformer架构,重塑AI版图。其作者“Transformer八子”中,Lukasz Kaiser加入OpenAI,参与GPT-4、GPT-5等研发。他10月将出席大会分享见解,曾预言多模态等趋势已渐成现实。
长视频生成可以回头看了!牛津提出「记忆增稳」,速度提升12倍
牛津大学团队提出VMem,把「看过什么」写进几何小片,用基于3D几何的记忆索引替代短窗上下文,实现「一致性更强、资源更省、速度更快」,实测速度比常规管线快约12倍。
真正的一句话修图:Gemini 用香蕉模型给出了图像生成的分水岭
Google新模型Gemini 2.5 Flash Image可在AI Studio体验。它有多图融合、角色一致性等能力,能实现自然语言编辑图像,速度快、价格低、API可用,虽有中文体验等问题,但有望让AI视觉工具进入工程化时代。