「影视AIGC实战进阶」共找到 459 篇相关文章
吴恩达开新课教OCR!用Agent搞定文档提取
随着AI大模型发展,OCR重新成为技术专项,DeepSeek、智谱、阿里千问和腾讯混元等都在研究。吴恩达开新课,提出智能体文档提取(ADE)方案,准确率达99.15%,还给出本地和云端部署线路。
含全文!OpenAI发布GPT-5官方Prompt指南
OpenAI 发布《GPT-5 prompting guide》,介绍新模型变化及使用方法。新增 `reasoning_effort` 和 `verbosity` 参数,还有 Responses API。Cursor 分享实战心得,同时提及控制 Agent 积极性、解决指令冲突等内容。
继Harness之后,“龙虾”JiuwenClaw率先开启“Coordination Engineering”时代
AI工程范式迭代快,行业面临‘定义赶不上进化’的焦虑。华为支持的openJiuwen社区发布新版JiuwenClaw,新增多智能体协同能力,提出‘Coordination Engineering’,实测中表现出高稳定性,可自主完成多项任务。
糟糕,大佬45年前论文,被判AI生成
随着AIGC增多,AI内容检测需求迫切,但表现远不及预期。如作家Adam Kay、教授Devi Sridhar等多人的作品被误判,原因或是AI用人类内容训练,使判断边界模糊。
ICLR 2026 | ESC — 解构一步生成,厘清细节,探寻本质
西湖大学研究人员针对一步扩散生成模型复杂性问题,提出统一设计框架,对代表性模型进行组件级分析,定位关键误差来源,提出ESC变体,在ImageNet 256×256上取得优异成果。
Anthropic 2026 Agentic Coding 趋势报告:软件开发的 8 大变革
Anthropic《2026 Agentic Coding Trends Report》基于企业实战数据,总结了AI编程Agent重塑软件开发的8大趋势,分基础、能力、影响三类,附企业案例,还给出2026年四大优先事项。
SIGGRAPH Asia 2025|电影级运镜一键克隆!港中文&快手可灵团队发布CamCloneMaster
香港中文大学与快手可灵团队联合提出运镜可控视频生成框架CamCloneMaster,引入‘参考即用’范式,告别对相机参数依赖。其训练、测试代码和数据集均已开源,在各项指标上优于SOTA方法。
论文深度解读:大模型(LLM)加持下的自主无人机分层智能体框架,实现自主规划
文章解读《A Hierarchical Agentic Framework for Autonomous Drone-Based Visual Inspection》论文,介绍分层智能体框架让无人机群自主规划。研究对比三种‘思考模式’与不同‘大脑’组合,还指出未来研究可开发混合系统、混合能力智能体及自适应系统。
LangExtract:用LLM 一键完成长文档信息抽取与可视化
在2025年大语言模型迅猛发展时,信息抽取成了NLP场景里的“硬骨头”。Google在7月30日开源的LangExtract利用多种LLM,实现“按指令抽取+源文对齐 + 一键可视化”的完整闭环,还给出使用步骤和进阶操作。
号称视频编辑领域的开源nano banana来了,用文字就能改视频
DecartAI开源Lucy Edit模型,号称视频领域开源Nano Banana,能理解自然语言指令改视频。如输入指令可精准换服装等,渲染快,有身份保持和动态适配亮点,有多个版本,应用场景广。