「可观测2.0」共找到 5880 篇相关文章
开源播客TTS神器!高效TTS模型:Muyan-TTS,0.33秒生成1秒音频,零样本语音合成!
介绍新发布的开源TTS模型Muyan - TTS,它专为播客场景设计,以超低延迟实现零样本语音合成,预训练大量播客数据,支持长内容连贯生成,还介绍了使用步骤、适用场景等。
用「传心术」替代「对话」,清华大学联合无问芯穹、港中文等机构提出Cache-to-Cache模型通信新范式
随着大语言模型发展,多智能体系统中现有T2T交流方式有信息丢失、语义模糊、延迟大问题。清华等团队提出C2C信息传递方式,以KV - Cache为媒介,提升了正确率和速度,还介绍了实现路径、优势及应用前景。
4K Star的多人 Agent 协作平台 Multica!Agent即队友,可像同事一样被指派、被追踪!
当前多 Agent 协同缺乏统一管理和经验沉淀,GitHub 开源的 Multica 平台解决了这一问题。它把编码 Agent 变成队友,自动化处理任务,支持多 Agent 后端,有多种功能特性,提供云服务和自托管两种使用方式。
ICML 2025 | 长视频理解新SOTA!蚂蚁&人大开源ViLAMP-7B,单卡可处理3小时视频
在视觉语言模型取得突破的当下,长视频理解挑战凸显。蚂蚁和人大团队提出视觉语言大模型ViLAMP,采用‘混合精度’策略,在多基准测试中超越现有方案,单卡可处理3小时视频,为实际应用带来新可能。
C3仓库AI代码门禁通用实践:基于Qwen3-Coder+RAG的代码评审
本文介绍C3仓库基于Qwen3 - Coder+RAG的代码评审实践,在CI流水线监听代码修改触发AI评审,可发现逻辑风险、拦截高危缺陷。该实践能提升评审效率与质量,可复用于代码门禁平台或辅助编程工具,当前仍在持续优化。
理解归 AI,正确归引擎:从一句话到一条实时数据链路(0代码搭建实时任务)
文章分享直播数据团队搭建AI辅助、指标驱动的实时数据端到端开发系统的实践与思考。从案例介绍用户使用流程,再深入系统内部讲链路构建与演进,阐述设计方法论,最后提出未来规划。
给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集
随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。
0.01%参数就能接近全量微调!低数据微调极致省参方案来了 | ACL'26
瑞典隆德大学与Google DeepMind团队研究大模型微调省参方案。发现低数据场景下,微调Value投影中的b(v)比b(q)或b(k)性能更好。该研究已被ACL 2026接收,集成进Hugging Face - PEFT库。
用2D数据解锁3D世界:首个面向运动学部件分解的多视角视频扩散框架
张昊等提出 Stable Part Diffusion 4D (SP4D) 框架,由 Stability AI 与 UIUC 联合完成。它能从单目视频生成多视角 RGB 与运动学部件序列,解决运动学部件分解及自动 rigging 问题,实验效果显著,被 Neurips 2025 接受为 Spotlight。
网络顶会获奖!华为提出端网协同RDMA传输架构,解决大规模AI集群网络可扩展性问题
全球网络通信顶会 ACM SIGCOMM 2025 落幕,华为与港科大合作的 DCP 研究成果获奖。该论文提出数控分离传输架构 DCP,解决大规模 AI 集群网络可扩展性难题,实验显示其性能优于现有 RDMA 方案。