评测榜单」共找到 1213 篇相关文章

新闻资讯7

「2025中国科技产业投资揭晓|甲子引力

2025甲子引力年终盛典在北京举办,现场发布【2025中国科技产业投资】,呈现投资机构卓越表现。2025年全球资本市场复苏,中国科技产业迈入关键阶段,投资具‘硬科技主导、长期主义、生态化布局’特征。

甲子光年
推荐文章8

评测也很酷,Data Agent 自动化评测的三层框架与实战

在大模型技术飞速发展下,评估应用效果成难题。字节跳动尹小明分享自动化评测技术,提出三层评测框架,还介绍 Text - to - SQL 及深度研究评测改进,以及评估平台建设,最后展望自动化评测未来方向。

AI前线
开源动态8

DeepEval:LLM 应用评测不再玄学,让大模型评测像写元测试一样简

在大模型应用开发中,科学、自动化评测 LLM 输出质量是难题,人工评测效率低。DeepEval 是 Confident AI 团队开源的 LLM 评测框架,能用极简代码让评测像写 pytest 一样自然,内置多种评测指标,支持批量评测等。

AI工程化
新闻资讯7

揭晓】2024-2025年度中国科技产业投资 | 甲子引力X

当前中国股权投资市场处于关键时期,科技投资呈‘止跌回暖’态势,但‘堵点’仍突出。投资正校准重构,硬科技成主导,AI相关领域成热点。2025年8月21日,甲子光年颁布‘2024 - 2025年度中国科技产业投资’。

甲子光年
算法论文8

BRIGHTSOTA!人大&百度ReasonRank:用推理增强的段落重排序器

传统listwise在复杂查询表现差,近期工作泛化性不佳。人大与百度等提出ReasonRank,通过全自动合成13K推理数据及两阶段训练,在BRIGHT等表现优异,且ReasonRank-7B比Rank1-7B快2.5倍。

PaperAgent
产品应用8

超脑未来WorldDreamer V4横扫多个权威,世界模型进入群体智能时代

超脑未来发布 WorldDreamer V4,它以多智能体为基本位,具多种核心能力。采用新预训练架构,引入 Masked Agent Modeling,用共享隐式世界状态带来新协同范式,还在多权威领先。

机器之心
产品应用7

模力工场 022 周 AI 应用:记忆型 AI Infra PowerMem 登顶首,本周 AI 应用全面升级“长期主义”

模力工场 022 周 AI 应用揭晓,PowerMem 登顶。涵盖底层基础设施与各类应用,体现 AI 满足多样需求趋势。采访 PowerMem 开发者,介绍其功能、优势、使用反馈及未来目标,还推荐了 GetDraft 起稿等应用。

AI前线
新闻资讯7

GPT-5.5反杀Claude登顶,AI编码旧不准了?

Datacurve推出新基准DeepSWE,号称「零污染」,用113道原创题挑战旧编程。它使GPT和Claude名次逆转,揭示旧基准验证误差大、存在作弊现象,虽有局限,但反映编程基准竞争转向抗污染和验证可信。

新智元
新闻资讯7

全球最大AI塌房!52%高分答案全是胡扯,硅谷大厂集体造假?

2025年底,《LMArena is a cancer on AI》一文引发关注,其指出LMArena这个权威大模型评测平台问题严重。Surge AI调查发现,52%获胜回答事实错误,39%投票结果与事实相悖,Meta还曾为优化模型。

新智元
新闻资讯7

实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩

Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准失真。

新智元