「LLM评估」共找到 1596 篇相关文章
Karpathy刚开源的autoresearch,我拿来优化龙虾skill,成功率从56%飙到92%
Karpathy发布开源项目autoresearch,可让AI优化AI。作者分享用其优化skill的实践,介绍优化流程,指出可将模糊表述拆成可判断是非题,还提及定义评估标准的方法与常见错误修正。此外,还能用于代码性能优化。
视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K
视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。
ICML 2026前瞻:投稿翻倍背后,机器学习正在换挡
第43届国际机器学习大会(ICML 2026)7月6 - 11日将在韩国首尔举行,主题为‘Machine Learning for the Real World’。今年投稿量翻倍,接收率26.6%,还做了两项制度调整。论文反映出LLM推理、AI安全、模型压缩等趋势,中国研究者表现亮眼。
小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一
6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。
密室逃脱成AI新考场,通关率不足50%,暴露空间推理短板丨清华ICCV25
清华大学团队受密室逃脱游戏启发,提出EscapeCraft:一个3D密室逃脱环境,用于评估多模态大模型在视觉环境中完成复杂任务推理的能力。该论文已入选ICCV 2025。研究评测了多个热门模型,发现它们在推理和探索行为方面存在诸多问题。
Karpathy 回应争议:RL 不是真的不行,Agent 还需要十年的预测其实很乐观
Andrej Karpathy 在与知名播客主持人 Dwarkesh Patel 的对谈中指出当下 LLMs 研究进展、Agents 存在的实际问题,如‘AGI 仍需十年时间’‘LLM 认知有缺陷’‘强化学习很糟糕’等。他还对关键争议点做了补充回应,包括对 AGI 时间线、强化学习局限性等的看法。
给AI打个分,结果搞出17亿估值独角兽???
大模型竞技场LMArena官宣拿下1.5亿美元A轮融资,估值升至17亿美元。它前身是Chatbot Arena,由LMSYS创建,核心成员多为顶尖高校学霸。LMArena评估规则有趣,成新模型必测榜单,计划用新资金运营平台、扩团队。
Anthropic最新博客:MCP没有死,我们又救活了。
2个月前Eric Holmes认为MCP已死,因其有Token成本等问题且LLM本就会用命令行。但本周Anthropic发博客称想清MCP定位,它不是替代CLI,而是覆盖其到不了的地方,还给出改进方案,MCP月下载超3亿次。
SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益
来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。
Docker 通过 Cagent 提供 AI 代理确定性测试
AI 代理系统普及,工程团队面临测试概率性输出的挑战。Docker 的 Cagent 是一种 AI 代理确定性测试方法,采用 proxy - and - cassette 模型,虽处早期,但揭示了 AI 代理测试的不同方向。