端到端同传」共找到 2452 篇相关文章

算法论文8

ACL 2025 | AI字幕慢半拍,不知道大家在笑什么?新方法让传性能直逼离线翻译

香港中文大学、字节跳动Seed和斯坦福大学团队提出SeqPO - SiMT框架解决声传译“质量 - 延迟”权衡问题。该方法将传建模为序贯决策过程,优化决策序列,实验显示其性能直逼离线翻译。

机器之心
产品应用7

谷歌Veo 3玩法大升级!“360°”关键词解锁3D效果,Fast版分辨率价格暴降5倍

谷歌旗舰视频模型Veo 3玩法再升级,添加“360°”提示词可解锁3D环绕效果。其Fast版速度更快、价格更便宜,分辨率下价格暴降5倍,虽面部细节和光照表现有下降,但解决了部分问题。

量子位
产品应用8

Google 发布首个全模态 Embedding 2 模型,文本图片音视频 PDF 统一一个向量空间

Google发布Gemini Embedding 2模型,它是业界首个原生支持文本、图片、视频、音频和PDF五种模态的Embedding模型,可将这些数据映射一向量空间,在多模态RAG、跨模态搜索等场景有应用,还介绍了跑分、用法、竞品、价格等情况。

AGI Hunt
算法论文8

原来Veo 3早有苗头!人大联合值得买科技在CVPR 2025提出全新「图像有声视频」生成框架

中国人民大学与值得买科技团队在CVPR 2025提出JointDiT框架,可从静态图像生成步音视频。此研究定义图像有声视频生成新任务,解决音视频融合难题,实验显示其效果优,还将拓展至四模态建模。

机器之心
新闻资讯7

Agent 不是渐进升级,而是要“换代”了:Cursor 工程负责人放话未来三六个月,行业将迎来大变局

本文是对Cursor工程负责人Jason Ginsberg的访谈。他认为编码Agent正换代,未来三六个月行业将大变,会接管复杂任务。还谈及编码Agent发展、Cursor使用方式、交互模式等,分享了产品开发、审查等看法。

InfoQ
产品应用7

苹果憋一年终超参数 Qwen 2.5?三行代码即可接入 Apple Intelligence,自曝如何做推理

今年 WWDC 大会上,苹果推出专为增强 Apple Intelligence 功能的语言基座模型,含约 3B 参数紧凑型与基于服务器的混合专家模型。经优化可在苹果芯片高效运行,改进工具使用与推理能力,评测显示设备模型表现优。

AI前线
新闻资讯7

“代码 + 编译器”要消失了?马斯克在 xAI 全员会上放话:今年年底,AI 或将直接生成二进制

xAI 近期出现离职潮,马斯克公开全员大会视频回应。他表示离职是阶段适配问题,还预测 2026 年底 AI 或直接生成二进制,跳过编程。此外介绍了 xAI 新架构及各团队进展,强调基础设施重要性,甚至提及将算力扩展月球。

AI前线
产品应用7

真香!我用AI做PPT的血泪史:从“能用”“真香”,V3版底解决了什么?

作者因公开分享需做PPT,尝试多种AI PPT工具后,自己围绕Agent攒了一个。从V1V3版不断改进,V3用多Agent提示词用法,风格多样且规则减少,还给出3步制作PPT的方法及后续功能拓展想法。

AI 产品自由
产品应用8

GPT-5.2全力出击!碾压44类专业工作,实测编程价位无对手、深度推理封神,但速度太拉胯了

GPT - 5.2 登场,有 Instant、Thinking、Pro 三个版本,在多方面大幅升级,能覆盖 44 类专业工作。它经济性强、编程能力佳、推理出色,但存在速度慢的问题,其价格 API 有调整,未来还将推 Codex 优化版。

AI前线
产品应用7

单张消费级显卡也能参与大模型训练!无问芯穹用「三个盒子」打通十万卡一张卡AI效能跃升路径

2025年WAIC上,无问芯穹联合创始人夏立雪带来AI落地新解——三个盒子,即无穹AI云、无界智算平台、无垠终智能,是面向未来的智能基础设施设计,能打通从十万卡一张卡的AI效能跃升路径。

量子位