「图像到视频」共找到 3237 篇相关文章
Qwen-Image-2.0: 字字清晰,张张细腻
阿里云推出Qwen-Image-2.0图像生成基础模型,具专业文字渲染、细腻真实质感等特色。在AI Arena盲测中表现优越,能精准生成复杂内容,文字渲染有准、多、美、真、齐特点,图像编辑能力也得到增强。
小模型,大能量!200美金的GPT Pro竟然输给了它?
博主用11个场景深度测试昆仑万维的Skywork R1V4 - Lite,它能做到Gemini 2.5 Pro才能干的事,速度快、成本低。在定位、人物识别、生活实用、专业鉴定、学术研究等场景表现出色,核心突破在于主动图像操作与深度推理。
⼤模型是万能的吗?探索机器学习+⼤模型在某出海投资业务的应⽤
本文基于公共云大客户出海投资业务案例,探讨用AI大模型结合机器学习算法构建投资预算预测与分配系统。历经三版方案迭代,从纯大模型到引入机器学习算法,目前项目处于落地阶段,有望实现多方共赢。
Codex自我蒸馏玩法火了!OpenAI员工亲授:复制粘贴就能让AI消灭重复劳动
OpenAI员工Vaibhav Srivastav爆出Codex「自我蒸馏」秘籍,复制提示词就能让它找出重复工作并打包。提示词从初版迭代到2.0版,覆盖更多场景且能直接创建项目。此外还介绍了Codex新功能及Vaibhav的其他玩法。
Agent 原生开发时代到来,Google Cloud Next 26 给开发者带来了什么
Google Cloud Next 26 大会热度高涨,反映行业对 Agent 原生时代的关注。Google Cloud 展示了云产业从 Cloud Native 到 Agent Native 的三层同步转换,还推出一系列 Agent 开发和管理套件,解决开发者关键问题。此外,大会亮点 A2UI 解决交互层 Agent 化。
我们离Coding领域的「AGI时刻」还有多远?字节跳动Seed发布NL2Repo-Bench仓库级长程代码生成基准
在AI编程领域,大家认为Coding领域的AGI似乎可以实现,然而真正的项目开发要求更高。近日,字节跳动Seed等联合发布首个评估编码智能体端到端仓库生成能力的基准测试NL2Repo - Bench,还介绍了其构建、评估等情况。
Agent 自我改进的六条路
文章梳理了让 AI Agent 不重新训练就能变强的六种机制,包括输出自审、持久记忆、进化搜索、对抗训练、自我修改和编排自优化,介绍了各机制代表项目及成果,指出 AI 学习正从训练溢出到部署阶段。
【DeepSeek-OCR系列第一篇】Language Modelling with Pixels【ICLR23】
当前主流语言模型依赖固定词表,扩展到多语言、多脚本时面临覆盖受限、计算昂贵、鲁棒性差等问题。ICLR 2023论文提出不依赖词表的PIXEL模型,通过将文本变成图像用视觉Transformer理解,实验验证其有跨语言、抗噪声等优势。
Sora 2干翻Veo 3?超全对比实测:会中文脱口秀,但体操翻车,附有效邀请码
OpenAI推出Sora2,可生成20秒1080p视频,在物理准确性等方面更优,还具备音画同步能力。文章对Sora2和谷歌Veo3进行多轮对比实测,涉及不同场景,也提及Sora2版权保护及App相关情况。
RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26
RAG已成大模型落地标配技术,但存在搜到对的文档、模型答案却离谱的痛点。德国萨尔大学等组成的团队诊断出问题在阅读理解,提出Disco - RAG框架,在“搜”和“答”间加“读懂”环节,已被ACL 2026主会录用。