长上下文窗口」共找到 1221 篇相关文章

算法论文7

基于离散扩散模型的高效音频修复方法

数字音频时代音频易损坏丢失,传统修复法处理间隙不佳。本古里安大学研究人员提出基于离散扩散模型的音频修复法,经MusicNet数据集实验验证,该方法在各间隙度上表现优异。

AIGC开放社区
算法论文8

仅需152个样本,性能提升48%:Memory-R1如何重塑Agent记忆能力?

这篇文章解读论文Memory - R1,其由多所高校研究团队完成,旨在解决LLM在对话和多轮任务中的‘记忆难题’。通过强化学习让LLM学会管理记忆,用152个问答对训练,大幅超越现有基线模型。

深度学习自然语言处理
算法论文8

EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!

近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。

深度学习自然语言处理
7

月烧35万元token、逼得Claude官方连夜限速!被全网吐槽的中国“榜一大哥”,已经靠 AI 年入千万了

X 用户“刘小排”认领月耗 5 万美元 Claude Code token。他靠 AI 年入近千万,用 AI 开发产品,还分享找需求、做产品等经验。他认为 AI 是期机会,能放大个人能力。

InfoQ
开源动态8

开源版Genie 3世界模型来了:实时+时间交互,单卡可跑,国内公司出品

本月初 Google DeepMind 发布 Genie 3 引发关注,没过两周昆仑万维就推出开源交互世界模型 Matrix - Game 2.0,参数量 1.8B,单卡可跑,能实现实时序列、交互式生成,经测试潜力大。

机器之心
开源动态8

基于闪电注意力机制,创新高效开源大模型

传统Transformer架构处理文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。

AIGC开放社区
产品应用8

千卡集群破壁之道:vivo视觉多模态大模型训练效率跃迁实战

多模态大模型在多领域需求增,但千卡级 GPU 训练挑战大。vivo AI 架构师王兆雄在大会演讲,结合 LLaVA 和 DiT 模型实践,解析优化策略,分享提升训练效率与稳定性的经验,还展望了 AI Infra 未来。

InfoQ
开源动态8

篇动画上色稳如老狗!全新开源LongAnimation

动画上色是制作篇动画时“烧脑”又“烧钱”的环节,现有AI主流方法多为局部处理,易导致色彩漂移、风格不统一。中国科学技术大学团队提出动态全局 - 局部范式,构建LongAnimation框架,可确保动画色彩一致。

带你学AI
推荐文章8

深度拆解:为什么通用 Agent 的下一站是 Agentic Browser?

文章指出 2025 年 AI 圈新风暴眼 Agentic Browser 正形成。从 Perplexity 故事讲起,阐述传统系统和浏览器限制通用 AI 发展。厘清通用 Agent、AI 搜索等概念,分析 Agentic Browser 成通用 Agent 下一站的原因,预测 OpenAI 相关产品秋季前发布。

Founder Park
产品应用7

作业帮基础观测能力之一监控体系实践

本文介绍作业帮监控体系实践。其监控体系随云原生成,支持全集群监控。构建时选 Prometheus 采集、VictoriaMetrics 存储,还从多维度采集指标,用自研代理降成本、治理指标,让系统更贴合研发。

InfoQ