性能测试」共找到 3298 篇相关文章

算法论文8

CVPR 2026 Oral|告别模型合并冲突!南大等提出OrthoReg:极简正交正则化,揭开任务算术的底层机制

南京大学等团队为任务算术建立底层理论框架,提出「任务特征特化」属性,推导出几何约束方法OrthoReg。该方法引入极简正交正则化项,提升模型合并性能,论文被CVPR 2026接收并评为Oral,代码等已开源。

机器之心
产品应用8

Claude「永久大脑」,真的来了!

著名AI追踪平台TestingCatalog爆出,Anthropic正为Claude测试「双模记忆系统」,包括「经典记忆」和「文件记忆」。此外,「梦境」预览版亮相,还有终极Agent平台Claude Conway登场,7x24h永不下线。

新智元
新闻资讯7

谷歌智能体发力:增强版Gemini Deep Research和专属API都来了

OpenAI强势更新,谷歌也没闲着。正式发布增强版的Gemini Deep Research,配套推出DeepSearchQA基准测试集,还发布了Interactions API,这不仅是Deep Research升级,还是Gemini生态的大升级。

量子位
算法论文8

Nature新研究:AI竟然分不清事实和信念

斯坦福大学团队在Nature发表研究,测试15个大模型,发现其区分事实、信念和知识存在严重缺陷。如处理第一人称信念准确率低,对语言线索依赖高,在高风险领域应用令人担忧。

AI工程化
开源动态8

让AI自动构建AI模型:UCSD 推出 AIBuildAI 智能体,斩获OpenAI MLE-Bench榜单第一

近日,加州大学圣地亚哥分校研究团队开发 AIBuildAI 智能体,可全自动构建 AI 模型。它在 OpenAI MLE - Bench 基准测试 75 个任务上以 63.1% 获奖率居榜首,实现端到端自动化。

机器之心
算法论文8

GraphRAG,这次被G-Reasoner统一了

大语言模型在知识密集型任务中存在局限,GraphRAG 也有迁移难题。G - Reasoner 提出统一框架,含 QuadGraph、GFM、LLM 增强推理模块,在性能、泛化、效率上全面领先现有方法。

PaperAgent
开源动态8

谷歌T5Gemma重燃架构之战!「套壳」反杀Gemma本尊,9B推理快得离谱

2023年以来大模型战场由decoder - only架构主导,Google双线出击。T5Gemma重燃encoder - decoder架构战火,性能提升显著;MedGemma坚守decoder - only路线,强攻医疗多模态,击穿闭源壁垒,打响开源反击战。

新智元
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
开源动态8

什么情况,一夜之间冲上热搜,狂揽29.6k星,再见吧SQLite!这个嵌入式分析引擎实在太香了

DuckDB是嵌入式OLAP数据库,被赞“分析型SQLite”。它采用列式存储和向量化查询引擎,性能佳,功能多,适合探索性数据分析等场景,能替代Pandas等,成本低。

小华同学ai
开源动态8

DeepSeek 硬核开源 DeepSeek-OCR-2!弃用 CLIP 改用 Qwen,创新视觉因果流!

昨天开源社区热闹非凡,Kimi 发布 K2.5,DeepSeek 则推出 DeepSeek - OCR - 2,用 LLM 架构替换传统 CLIP 视觉编码器。它核心创新是视觉因果流,能智能规划阅读路径,性能高效且全量开源。

开源星探