「口型同步」共找到 165 篇相关文章
Claude Opus 4.7炸场,6美元造《我的世界》,临门AGI前强调安全,打工人却更慌了
Anthropic 发布‘目前最强 Opus 模型’Claude Opus 4.7,能力跃升,在多榜单夺冠。写代码、看图表等能力提升,也有网页搜索等能力下降。还展现出游戏开发实力,同步上线Claude Code新功能,加强安全防护。
一个模型统一4D世界生成与重建,港科大One4D框架来了
港科大研究团队提出 One4D 框架,可统一 4D 生成与重建,构造同步输出多模态的视频扩散模型,支持多种任务形态。其有 DLC、UMC 等亮点,用合成与真实数据混合策略训练,实验表现佳。
鹅厂员工的“神之一手”代码都长什么样?
文章分享6位鹅厂同事的“神之一手”代码。有将快排浓缩到5行的Python代码,有解决逆序打印不可变链表的方案,还有修复订单状态同步漏洞、解决内存泄漏等代码,文末邀读者分享代码赢福利。
社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型
Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持单/多向量表示。介绍了架构、上手指南等。
刚刚,好莱坞特效师展示AI生成的中文科幻大片,成本只有330元
AI领域发展迅速,视频生成能力提升。百度全球首发中文音视频一体化模型百度蒸汽机2.0,实现人物口型等毫秒级同步,多版本升级且价格有竞争力。实测效果好,技术上解决难题,还开创应用驱动研发范式。
刚刚,千问App把谷歌和OpenAI的「付费绝活」塞进了手机,还免费?
千问App迎来史诗级更新,接入阿里两大视觉模型Qwen - Image和Wan 2.5。Qwen - Image在图像编辑上有强大视觉逻辑理解和一致性保持能力;Wan 2.5能实现原生音画同步。千问App还实现一站式工作流。
sgl-kernel MoE Align Block Size Kernel 优化过程解析
文章记录SGLang的sgl-kernel中优化 `moe_align_kernel.cu` 的过程。MoE模型的 `moe_align_block_size` kernel从最初的baseline版本经多次迭代,包括加向量化padding、用Blelloch Scan并行化前缀和、用Warp Scan减少同步开销等。
Turso:用 Rust 重写 SQLite,让数据库跑在每一个边缘节点
Turso用Rust重写SQLite内核,解决其单写者限制和缺乏网络同步能力的短板。它有嵌入式副本、边缘同步和向量搜索等特性,适用于AI Agent、多租户SaaS等场景,与竞品相比优势独特。
CVPR2025 | 多模态LLM评测Tutorial
多模态大语言模型(MLLMs)研究热门,有效评估成关注焦点。CVPR2025将举办多模态LLM评测Tutorial,梳理评估基准,探讨评估方法,聚焦‘幻觉现象’,团队经验丰富,覆盖多板块内容。
年入1400亿!奥特曼印钞机转疯了,AGI尽头是卖广告
今早OpenAI CFO揭秘成绩单,2025年ARR破200亿美元、算力达1.9GW,算力与收入深度绑定。其商业版图多元,还将涉足广告。预测2026 - 2029年收入可观,2029年或达1400 - 1500亿美元。