「视觉质量」共找到 1246 篇相关文章
Anthropic再次声明:Claude降智问题已解决。网友:我累了……
Anthropic发布声明,称已解决影响Claude响应质量的两个问题,这是10天内第二次修复。此前Claude就出现过质量下降问题,引发‘降智阴谋论’,还让其失去一批订阅用户,且上次修复存在‘先瞒后报’情况。
细粒度视觉推理链引入数学领域,准确率暴涨32%,港中文MMLab打破多模态数学推理瓶颈
香港中文大学MMLab团队发布MINT - CoT视觉推理方案,解决多模态数学推理难题。它引入特殊Interleave Token,构建专属数据集,采用三阶段训练策略,实验效果全面超越现有方法。
NovaSR:一个52KB的音频超分模型,把16kHz模糊音频变成48kHz清晰版
最近,只有52KB的音频超分辨率模型NovaSR开源,能把16kHz模糊音频变成48kHz清晰版,处理速度极快,可实时处理音频流。它能提升TTS模型质量等,虽有不足,但平衡了速度与质量。
ICML spotlight | 一种会「进化」的合成数据!无需上传隐私,也能生成高质量垂域数据
大模型发展使数据短缺问题加剧,特殊领域更严重。为此提出合成数据自主进化框架PCEvolve,只需少量标注样本,就能在保护隐私同时进化出数据集,还介绍了其架构、选择器设计及实验结果。
750城市+5000小时第一人称视频,上海AI Lab开源面向世界探索高质量视频数据集
上海人工智能实验室等机构联合推出持续迭代的高质量视频数据集项目Sekai,含Sekai-Real和Sekai-Game两个数据集,还训练了模型Yume。它特点突出,团队按四环节构建,望成世界建模等领域的数据基石。
不改模型、不降质量,谷歌让Gemma 4快了3倍:本地跑大模型彻底变天
谷歌给Gemma 4家族更新Multi - Token Prediction推测解码架构,推理速度最高提升3倍且输出质量不变。介绍了LLM推理慢的原因、MTP解决办法、对开发者的利好、技术细节、使用方式等。
StereoAdapter:北大首提自监督,适配水下双目深度估计
水下机器人深度感知难题待解,北大等机构提出StereoAdapter框架。它结合单双目视觉,以自监督学习适配视觉基础模型到水下域,设计双阶段结构、自监督训练策略等,实验效果好,未来还将多方面改进。
录屏扒代码、截图改网页!Kimi K2.5把「视觉x代码」玩明白了
Moonshot AI推出最强Agentic模型Kimi K2.5,发布后热度起飞。它实现多功能一体化整合,具备设计审美,支持可视化编辑,推出编程工具Kimi Code。在多项测试中表现优异,还能在办公领域发挥作用,其智能体集群提升了效率。
ICCV 2025 | FDAM:告别模糊视界,源自电路理论的即插即用方法让视觉Transformer重获高清细节
针对视觉 Transformer(ViT)‘低通滤波’特性致细节丢失问题,北京理工大学等团队提出即插即用的 FDAM 模块。它受电路理论启发,能提升模型在分割、检测等任务性能,取得 SOTA 效果,有巨大应用潜力。
ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链
随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。