推理性能」共找到 3460 篇相关文章

算法论文7

一场「狼人杀」,考倒了一堆大模型

南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。

AI科技评论
开源动态8

Meta视觉基座DINOv3王者归来:自监督首次全面超越弱监督,商用开源

Meta推出并开源视觉基础模型DINOv3,采用自监督学习,首次全面超越弱监督,可生成高质量高分辨率视觉特征。它在多任务表现出色,参数和数据量提升,还构建模型家族,已在多领域产生实际影响。

机器之心
算法论文8

超低标注需求,实现医学图像分割!UCSD提出三阶段框架GenSeg

GenSeg用AI生成高质量医学图像及对应分割标注,在仅有几十张样本时也能训练出媲美传统深度模型的分割系统,显著降低医生手工标注负担。它是通用、与模型无关的框架,可集成到现有分割模型。

新智元
算法论文8

AI修Bug新SOTA:SWE-Bench Lite60.33%修复率,像人一样能积累经验,中科院软件所出品

ExpeRepair是中科院软件所团队推出的仓库级缺陷修复系统,模拟人类认知的情景和语义两种记忆模式,能积累经验。在SWE - Bench Lite评测中,其Claude - 4+o4 - mini组合修复率达60.3%居首。

量子位
新闻资讯7

搜索市场变天:AI搜索用户使用频次夸克6倍于传统巨头

QuestMobile报告显示,2025年上半年夸克AI搜索月人均使用频次是百度6倍多。夸克切中高频刚需场景、有基础能力且受年轻用户青睐。在产品性能维度,夸克已超百度,AI搜索市场正变天。

鲸选AI
新闻资讯8

刚刚,Claude 4.1 发布

刚刚,Anthropic 发布 Claude Opus 4.1,对智能体任务、编码和推理能力全面升级,付费用户已可使用。未来几周还有重大改进。它在多方面能力提升,碾压对手,网友反应热烈。

AGI Hunt
8

4倍无损压缩Diffusion,6倍加速!仅需时间特征维护 | TPAMI'25

扩散模型时间特征对量化敏感,现有量化方法会致其扰动,影响图像质量。港科大等多校团队提出TFMQ - DM框架,优化时间特征相关模块,提升低比特量化性能,实现硬件加速。

新智元
开源动态8

开源TTS语音新标杆!Kyutai TTS:350ms延迟碾压全场,词级时间戳重构!

法国AI实验室Kyutai开源高性能TTS语音模型Kyutai TTS,基于DSM框架,支持流式输入、超低延迟与高保真语音生成,有多项亮点,还给出不同使用方式及应用场景。

开源星探
开源动态8

不靠Agent,4步修复真Bug!蚂蚁CGM登顶SWE-Bench开源榜

蚂蚁集团代码图模型 CGM 基于开源模型,不靠 Agent 架构,用 4 步轻量级流程完成仓库级代码修复,在 SWE - BenchLite 公开排行榜成绩亮眼,打破闭源垄断,还解决了 LLM + Agent 架构的一些问题。

机器之心
算法论文8

国产芯片比英伟达整体效率更高!?华为 CloudMatrix384 超节点首曝论文,跑 DeepSeek 效率超越英伟达

今年4月,网上曾争论华为芯片效率是否超国际主流。近日华为团队论文公开,阐述在CloudMatrix 384超节点部署DeepSeek大模型细节,性能指标超英伟达体系,还介绍架构、软件栈及适配优化方案。

InfoQ