时长控制」共找到 1601 篇相关文章

算法论文8

链式思维是幻象吗?从数据分布视角重新审视大模型推理,马斯克回复,Grok破防

亚利桑那州立大学研究发现,思维链(CoT)推理可能只是对训练数据分布内模式的复现,输入与训练数据分布有差异,推理链条会失效。研究探究了CoT泛化性等问题,对实际应用提出警示。

机器之心
算法论文7

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。

机器之心
产品应用7

LLM加速利器LMCache,极大降低GPU资源消耗

LMCache是大语言模型服务引擎扩展组件,能降低首次响应延迟、提升吞吐量,适用于上下文场景。它将KV缓存存于多级存储,跨服务实例复用任意重复文本的KV缓存,节省GPU算力,与vLLM结合优化显著。

GitHubStore
新闻资讯7

刚刚,微软推出AI浏览器,上网从此不一样了

微软Edge浏览器推出“Copilot模式”,将其变成AI智能体,有跨标签页情境感知等功能。该模式限免费,支持语音控制等,还将增加新功能。微软此举或引发浏览器大战,未来浏览器AI模式可能收费。

量子位
新闻资讯7

微软为3万名政务人员提供Copilot AI

CNBC消息,旧金山市宣布为3万政府人员提供微软Copilot AI,用于行政工作提效。经六个月试点,该AI为人员每周提效5小,还能处理多语言翻译等事务,使旧金山成全球应用AI最多城市之一。

AIGC开放社区
算法论文8

用动作分块突破RL极限,伯克利引入模仿学习,超越离线/在线SOTA

如今强化学习在多领域成果显著,但在跨度、稀疏奖励任务中表现欠佳。加州大学伯克利分校研究者提出Q - chunking方法,将动作分块引入基于序差分的强化学习,解决探索效率和值传播问题,实验表现优异。

机器之心
产品应用8

空间智能率先落地国民APP!实测:空决策很顺滑,直达千人N面出行体验

空间智能虽前沿,但在有场景和业务优势能快速落地。高德地图2025版内测,其“小高老师”智能体按需提供出行和生活建议,AI导航有超视距感知能力,是迈向空间智能的国民APP。

量子位
新闻资讯8

模型训练最重要的依然是 Scaling —— 对话阿里通义千问 Qwen 多语言负责人杨宝嵩 | Open AGI Forum

本文是对阿里通义千问Qwen多语言负责人杨宝嵩的专访。他透露Qwen一开始就将国际化视作核心战略,团队建立文化标注体系确保内容安全合规。还谈到多语言推理难题及应对策略,认为扩大模型规模和数据量仍重要,合成数据是延续Scaling Law的关键。

AI科技大本营
开源动态8

103K「硬核」题,让大模型突破数学推理瓶颈

现有大语言模型在数学推理训练面临数据瓶颈,腾讯AI Lab与上海交大团队推出DeepMath - 103K数据集。它规模大、难度高、数据新颖、严格去污染,让DeepMath系列模型达SOTA,还能实现推理泛化。

机器之心
开源动态8

MetaShuffling:Meta的Fused MoE kernel工程方案,更激进的Kernel优化和尽量避免Padding

文章介绍Meta的Fused MoE kernel工程方案MetaShuffling,可高效部署Llama 4模型。它处理MoE推理挑战,介绍多种token选择路由方案,阐述运行设计、不同并行化方式及优化思路,还展示性能测试与Trace分析。

GiantPandaLLM