「语音时长控制」共找到 1318 篇相关文章
ICLR 2025新成果:文档检索“降本增效”,从此“开挂”
传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展到图文+音频多模态匹配。
编码器-解码器架构的复兴?谷歌一口气发布32个T5Gemma模型
谷歌在xAI吸引眼球时更新Gemma系列模型,发布多模态模型MedGemma,还一口气推出32个T5Gemma模型。该模型基于适应技术,性能表现佳,引发编码器 - 解码器架构复兴讨论。
模型压缩与量化:让大模型走向轻量化落地
文章介绍模型压缩与量化技术,其能在保持性能时降低大模型计算和存储需求,实现边缘设备高效部署。还阐述基础知识、关键技术路径、应用场景,并探讨未来发展方向。
马斯克祸不单行!擎天柱负责人突然离职,特斯拉蒸发万亿市值
特斯拉创下单日最大跌幅,市值蒸发1500亿美元时,擎天柱Optimus项目负责人Milan Kovac宣布离职。他是特斯拉十年老将,离职因想多陪家人。现任AI软件副总裁Ashok Elluswamy将接替其工作。
Meta Shuffling的MoE Grouped GEMM kernel benchmark
作者拷贝fbgemm开源的moe grouped gemm kernel,修复小bug后与SGLang的Grouped GEMM Triton Kernel对比,结果显示fbgemm在MoE模型上性能提升显著,可应用到SGLang的ep - moe的grouped gemm kernel中。
DeepMind 提出 CaMeL,抵御 LLM 提示词注入
谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询中的控制流和数据流阻止恶意输入,能在AgentDojo基准测试中抵御67%攻击,采用传统软件安全原则。
一个LoRA实现GPT-4o级图像编辑!浙大哈佛新模型冲上Hugging Face榜二
随着Gemini、GPT - 4o等把基于文本的图像编辑推向高峰,提高性能常需大量数据和大参数量模型。而浙大哈佛团队提出ICEdit,用少量数据和参数实现高质量图像编辑,媲美甚至超越商业大模型。
答对了却没看图?EASE给多模态RLVR装上「视线校正器」
强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。
具身智能本体的重要性和技术差距,可能被大大低估了
目前,具身智能发展的讨论多聚焦模型和数据,而本体易被忽视。灵御智能凭借高性能本体在‘申智杯’夺冠,其灵御TA2机器人受关注。文章从多维度剖析本体重要性,并介绍了灵御TA2的优势。
VLA动作预测必须经过LLM吗?TurboVLA仅0.2B参数,RTX 4090上跑出32Hz在线动作预测
近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。