「CI回归测试」共找到 1957 篇相关文章
Transformer八子初创:AI横扫NP难题竞赛,Top 2%选手竟是智能体!
Transformer作者Llion Jones初创公司测试AI智能体,其在NP难题竞赛中排第21。Sakana AI与AtCoder合作构建ALE - Bench,设计ALE - Agent参赛成绩优异,不过它也有调试难等局限,未来待改进。
最大的开源GraphRag:知识图谱完全自主构建|港科大&华为
香港科技大学KnowComp实验室与香港华为理论部提出AutoSchemaKG框架,可自主构建知识图谱,无需预定义模式。该系统利用大模型提取知识三元组并归纳模式,构建了ATLAS系列知识图谱,经测试表现优异。
马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1
谷歌Gemini 3将上线消息正热时,马斯克旗下xAI的Grok 4.1凌晨上线。它有两个“形态”,免费开放且有APP版。在LMArena测试中表现优异,事实稳定性、情商、创意写作等能力提升,实测也有不错表现。
统计学和机器学到底有什么区别?
文章探讨统计学和机器学习的区别,指出两者目的不同,统计模型重推断关系,机器学习重预测。以线性回归为例说明差异,还澄清常见误解,表明机器学习基于统计学但涉及多领域,最后称选方法要看目标。
爆删80%系统提示词!Anthropic核心成员揭秘Claude 5最新玩法:上下文工程全面大换血
Anthropic针对Claude Opus 5、Claude Fable 5等新模型,删超80%Claude Code系统提示词,编码测试成绩无明显下降。CC技术团队成员发文指上下文工程规则重写,还总结新旧规则对比,并给出内容撰写建议,还上线新命令。
马斯克悄然发布Grok 4.1,霸榜大模型竞技场所有排行榜
马斯克发布Grok 4.1,同时霸榜大模型竞技场第一和第二。它在思考与非思考模式表现出色,还在新专家榜和职业榜霸榜。此外,它在情商测试表现佳,还加强快速回复、改善幻觉问题,已向所有用户开放。
LeCun亲自出镜打脸质疑者!憋了20年的AI世界模型,终于爆发了
LeCun亲自出镜介绍V-JEPA 2新进展,目标是开发改变AI与物理世界交互的世界模型。V-JEPA 2基于视频训练,有两阶段训练细节,能用于机器人规划,Meta还发布三个基准测试,后续将研究分层和多模态JEPA模型。
引入小目标注意力模块改进YOLO12用于无人机视角下的岸边人员玩水检测
文章介绍用小目标注意力模块改进YOLO12,用于无人机视角下岸边人员玩水检测。先介绍YOLO12特点与结构,再说明小目标注意力模块CBAM优势、流程及代码,接着阐述改进方法、数据集情况,最后给出训练和测试模型的代码与结果。
AMS| 西工大史子颉,高传强,王旭,林海涛,张伟伟:数据驱动的涡激振动标度律发现
涡激振动最大振幅是评估结构安全的关键指标,现有理论模型有局限,常用数据驱动方法也面临挑战。本文提出两次应用符号回归的“白箱”标度参数VIV建模方法,验证了其鲁棒性与泛化能力,还给出物理层面解释。
Auto Research时代,47个没有标准答案的任务成了Agent能力必测榜
Einsia AI旗下Navers lab发布Agent Benchmark——Frontier-Eng Bench,让AI在47个多学科交叉的硬核任务中做工程优化,测试其迭代优化能力。研究总结出AI进化规律,初步勾勒接近真实工程循环的AI系统。