端到端语音模型」共找到 8120 篇相关文章

算法论文8

内存直降50%,token需求少56%!用视觉方式处理长文本

在NeurIPS 2025论文中,南京理工大学等校研究团队提出VIST框架,为大语言模型长文本高效推理提供视觉解决方案。它模仿人类阅读机制,让模型具备选择性阅读能力,减少Token需求和内存使用。

新智元
新闻资讯7

AI泡沫越大鱼越贵!YC合伙人复盘2025年AI创业

2025年底Y Combinator博客复盘该年AI四大变局,如Anthropic成最受欢迎大模型,使用率超OpenAI。创业者可在模型间套利,创建垂直AI应用。能源焦虑催生太空数据中心,AI泡沫或成应用层红利。

新智元
算法论文8

GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化

GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。

机器之心
新闻资讯7

ICML2026 | 全新评审政策出炉!作者可选:评审是否使用AI

ICML 2026 为应对预期投稿量,提出互审数量限制和 AI 使用规定。此次引入评审类型选择机制,作者可决定评审是否用大模型,分严格禁止的政策 A 和有限制允许的政策 B,但执行或有困难。

AINLPer
开源动态8

杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切争议

上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,引发广泛关注。今日凌晨,杨植麟等团队成员在 Reddit 开展 AMA 活动,回应 K2 Thinking 相关问题,如 KDA 机制应用、训练成本、速度与准确性平衡等。

AI前线
新闻资讯8

OpenAI还在讨论“异星心智”,乐享科技已经造出来了|甲子光年

本文对比OpenAI对异星机器心智的风险预警,介绍中国乐享科技基于仿生神经科学思路,研发出面向机器人的以太大模型,已完成多场景验证,将举办户外开放直播测试,探索具身智能新路线

甲子光年
产品应用7

Cursor Composer 2.5 拆解:最强大的 RL 环境,就是你自己的产品

今年5月,Cursor推出Agentic编程模型Composer 2.5,相比前代能力更强、成本效率更高。Cursor研究负责人认为最强大的RL环境就是自己的产品,文中还介绍了Composer 2.5训练方式、面临的挑战及解决办法等。

Founder Park
新闻资讯8

击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军

在具身灵巧操作奥林匹克赛事Benjie’s Olympics中,中国具身智能公司星动纪元斩获三项全球第一,超越美国明星公司PI。其自研VLA具身模型优势显著,且已在多领域落地应用。

量子位
算法论文8

苹果再发论文:精准定位LLM幻觉,GPT-5、o3都办不到

近日苹果发布重磅论文,提出 RL4HS 方法,用强化学习训练模型,能准确标出答案中幻觉部分,还使用片段级奖励和类别感知的 GRPO,在片段级幻觉检测任务上超 GPT - 5 和 o3。

机器之心
算法论文8

蚂蚁VLDB最佳论文:用一张“逻辑表”驯服3050亿条训练数据

蚂蚁集团论文《OmniTable: A Unified Wide-Table System for Petabyte-Scale LLM Data Curation and Exploration》获VLDB工业赛道最佳论文。其研发的OmniTable系统能管理超35PB、3050亿条以上训练数据,解决数据准备难题,如在SFT任务中大幅缩短周期。

量子位