「策略性能提升」共找到 4610 篇相关文章
刚刚,新版DeepSeek-R1正式开源!直逼o3编程强到离谱,一手实测来了
临近端午假期,新版DeepSeek - R1凌晨正式开源,模型权重已上传到HuggingFace。其性能几乎与o4 - mini(Medium)相当,编程实测超越Claude 4 Sonnet。有多项更新亮点,经实测性能获“史诗级”加强。
西交大提出QQWorld:仅需10行代码,世界模型成功率提升5.33个百分点
2026 年 3 月 Yann LeCun 等人提出 LeWorldModel,西安交通大学研究团队发现其存在问题,进而提出 QQWorld,用分位数—分位数匹配替换原有的 EP 正则,提升了规划成功率,还提出 Cross - Batch QQ 解决显存问题。
不换模型,效果提升104%!上海AI Lab让Harness也能自进化了
上海人工智能实验室团队提出的Self-Harness引发关注,它针对Agent外层Harness改进。实验显示,在Terminal-Bench-2.0上,不换模型只改Harness,Qwen3.5-35B-A3B等模型效果显著提升。
你敢信?GPT-5的电脑操作水平只比人类低2%了
Agent S3刷新了计算机使用智能体(CUA)在「OSWorld」基准测试的记录,性能达69.9%,接近人类水平。它引入bBoN实现并行扩展,还精简框架、引入原生代码智能体,已开源并发布论文。
微软刚发布Mu模型:支持Windows智能体,小参数跑出10倍性能
今天凌晨微软发布创新小参数模型Mu,3.3亿参数性能比肩Phi - 3.5 - mini,体量小10倍,离线NPU笔记本每秒超100 tokens响应。它支持Windows智能体,架构有多项创新,经训练优化后智能体表现出色。
仅需10%思维链标注,等同全量性能!中科院发布推理监督新范式
中科院计算所团队提出新框架PARO,让模型学习固定推理模式自动生成思维链,只需标注1/10数据就能达全量人工标注性能,适合规则清晰领域,为推理监督提供新思路。
一文全解析:AI 智能体 8 种常见的记忆(Memory)策略与技术实现
本文剖析8种常见AI记忆方案,如全量记忆、滑动窗口等,分析其原理、特点和适用场景,还给出模拟代码助理解。不同策略各有优劣,适用不同对话场景,能为项目评估、选择和实现Memory方案提供参考。
一边秀肌肉,一边设围墙,NVIDIA 发布 OmniVinci,性能碾压 Qwen2.5-Omni,却被骂“假开源”
NVIDIA 推出多模态大模型 OmniVinci,结合架构创新与合成数据流水线,训练 token 仅为 Qwen2.5 - Omni 的六分之一,却在多项基准测试表现更佳。但采用限制商业用途的许可证,引发“假开源”争议。
小米小爱同学:资源受限下,实现端侧大模型的高性能推理
InfoQ对话小米小爱同学端侧AI负责人杨永杰,了解其团队在资源受限的端侧设备实现大模型高性能推理的策略。目前端侧大模型商业化落地慢,团队提前布局,自研框架,实现超180 tokens/s推理速度,还分享未来突破方向。
2026论文解读,ASAHI:自适应切片助力小目标检测,速度提升25%、精度创新高
高分辨率航空图像小目标检测难,传统检测器表现差。2026年4月都灵理工大学团队提出ASAHI,用自适应切片框架,在VisDrone2019上mAP50达56.8%,推理速度比SAHI提升20 - 25%,还介绍了实战代码等。