长语音」共找到 864 篇相关文章

开源动态7

DeepSeek-OCR降本增效,10×暴力压缩还能读得清

Deepseek - OCR模型发布,通过光学压缩技术解决文本处理的计算效率问题,能控制大模型token消耗成本。介绍了其架构设计、数据引擎及训练流程,还展示其用较少token超越现有模型的能力。

CourseAI
开源动态8

DeepSeek开源的不仅仅是个新OCR模型。。。

DeepSeek开源3B参数的新OCR模型,重新思考AI处理文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。

AI工程化
产品应用8

AI视频生成走向“演技生成”时代,生数科技Vidu全球发布Vidu Q2 | 甲子光年

9月25日,生数科技全球上线新一代图生视频大模型Vidu Q2,实现从“视频生成”到“演技生成”跨越。它在表情生成、运镜、语义理解、时选择等方面有提升,分闪电和大片模式,已在多端上线。

甲子光年
新闻资讯8

时隔多年,AI芯片又是华为发布会主角了

华为全联接大会上,轮值董事徐直军带来全球最强算力超节点和集群。公布昇腾、鲲鹏芯片未来2年演进规划,还开创灵衢互联协议。虽单芯片受限,但集群层面有望实现超越。

量子位
推荐文章8

极佳科技朱政:世界模型会进化成 VLA 的下一代|具身先锋十人谈

具身智能领域数据难题待解,极佳科技朱政投身世界模型研究。他认为世界模型短期内是‘驯化’VLA的容器,期或与VLA融合。其团队成果显著,还将探索多维度建模与数据配比优化。

AI科技评论
算法论文7

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。

机器之心
产品应用7

LLM加速利器LMCache,极大降低GPU资源消耗

LMCache是大语言模型服务引擎扩展组件,能降低首次响应延迟、提升吞吐量,适用于上下文场景。它将KV缓存存于多级存储,跨服务实例复用任意重复文本的KV缓存,节省GPU算力,与vLLM结合优化显著。

GitHubStore
新闻资讯8

Google重磅上线通用世界模型Genie 3 - 此即未来。

Google发布世界模型Genie 3,它与Sora等AI视频产品本质不同,像可实时演算的模拟器。Genie 3解决了前辈无法调和的矛盾,在交互、时、控制等方面有突破,虽有局限,但打开新世界大门。

数字生命卡兹克
新闻资讯7

刚刚,微软推出AI浏览器,上网从此不一样了

微软Edge浏览器推出“Copilot模式”,将其变成AI智能体,有跨标签页情境感知等功能。该模式限时免费,支持语音控制等,还将增加新功能。微软此举或引发浏览器大战,未来浏览器AI模式可能收费。

量子位
新闻资讯7

微软为3万名政务人员提供Copilot AI

CNBC消息,旧金山市宣布为3万政府人员提供微软Copilot AI,用于行政工作提效。经六个月试点,该AI为人员每周提效5小时,还能处理多语言翻译等事务,使旧金山成全球应用AI最多城市之一。

AIGC开放社区