端到端自动驾驶」共找到 1052 篇相关文章

开源动态8

面壁小钢炮 VoxCPM-TTS:开源 TTS,轻量高效低延迟

面壁提出基于扩散自回归建模的语音生成模型 VoxCPM,构建于 MiniCPM - 4 之上。它克服传统离散 token 方法缺陷,实现语义与声学特征解耦,有上下文感知语音生成和零样本语音克隆能力,低延迟。

带你学AI
新闻资讯7

你的扫描全能王,作价217亿冲刺港股IPO

扫描全能王母公司合合信息拟作价217亿赴港IPO,冲刺“A+H”双重上市。其C有扫描全能王等产品,B有TextIn等产品。合合以文本智能技术为核心,打造三大技术平台,C靠付费订阅、B卖产品模块盈利。

量子位
开源动态7

自动把PDF转换为可填写表单的开源工具,实用可落地。

CommonForms是能自动将PDF转换为可填写表单的开源工具,通过检测文本框等自动添加交互字段。它基于YOLO11做目标检测,支持CLI和API使用,有多种功能特点,能高效处理转换。

开源AI项目落地
开源动态8

新型开源 AI 语音模型!Voila:195ms 超低延迟引领全双工对话!

Maitrix团队发布开源AI语音模型Voila,以195ms超低延迟及全双工对话受关注。它功能强大,支持多语言,有多种使用方式,适用于多个场景,架构采用模块化设计。

开源星探
新闻资讯8

一个大脑控制所有机器人,真的可能吗?特斯拉、Skild AI、Agility 激辩人形机器人的量产路线|GTC 2026

GTC 2026 上,特斯拉、Skild AI 等公司就人形机器人量产路线展开讨论。涉及数据采集、仿真作用、模型架构等话题,各公司观点不一,如特斯拉强调,Skild AI 看重通用大脑,反映出行业在迈向量产时的探索与分歧。

AI科技大本营
产品应用8

阿里发布首个「音视频实时交互」模型,实现数字人实时视频聊天

阿里发布原生流媒体模型Wan - Streamer v0.1,能实时聆听、观看、思考、说话和响应视频。它在单个Transformer内完成感知等操作,延迟低,具备多模态统一、低延迟等特点。

开源AI项目落地
新闻资讯7

国内AI应用半年报告:App和Web应用月活都在跌,AI搜索需求被验证,百度是DeepSeek流失用户最大接盘手

QuestMobile发布2025年国内AI应用上半年报告,指出国内与海外市场情况不同,国内移动和PCAI产品月活下滑,AI搜索需求被验证,百度成DeepSeek流失用户最大接盘手,还分析了各类型AI应用发展态势。

Founder Park
开源动态8

HF日趋榜一!真模型AutoDeco终结手动调参解码

大语言模型手动调参解码繁琐,腾讯AI Lab王琰团队联合港中大(深圳)唐晓莹教授团队推出AutoDeco架构,通过创新训练策略让模型动态预测解码参数,在多模型实验中表现出色且已开源。

机器之心
算法论文8

无需训练,即插即用,2倍GPU推理加速——视频扩散模型加速方法DraftAttention

高质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。

机器之心
算法论文8

突破一亿Token极限:EverMind提出MSA架构,实现大模型高效长时记忆

机器之心发布文章介绍,大模型长期记忆能力受限于上下文长度。《MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens》提出MSA架构,突破扩展性、精度和效率的不可能三角,实现100M长度的大模型长时记忆框架。

机器之心