LLM评估」共找到 1596 篇相关文章

开源动态8

o3绞尽脑汁仅答对40%的题目,开源模型基本乱猜?MMSI-Bench:多图空间智能试金石

文章介绍了MMSI - Bench,这是用于评估MLLM多图像空间推理能力的VQA基准。它人工构建样本、全面分类任务、采用多样真实数据。实验显示MLLM在多图像空间推理有短板,还开发自动化错误分析流程助力改进。

量子位
推荐文章7

Self-Evolving 会是 2026 关键词吗?

2025年,Agent应用发展使LLM‘静态’局限成AI瓶颈,业界重视自进化能力,聚焦‘持续适应系统’。但该领域缺统一标准,有思潮认为统一标准、集体探索将带来机遇。还介绍了研究进展、重点演变等。

机器之心
推荐文章8

5 分钟搞懂开源大模型选型核心维度,16G显卡也能选对

文章以作者自身经历引入,指出开源大模型选型易陷入‘越大越好’误区。讲透选型4个核心维度,含实操步骤与避坑指南,还介绍选后评估方法,助新手快速锁定适配模型。

机器学习AI算法工程
新闻资讯8

Andrew Karpathy最新访谈:RL很糟糕、人类学习和教育、智能和文化的演变、AGI还要十年,将带来2%的GDP增长

Dwarkesh Patel 播客对 Andrej Karpathy 进行深度访谈。他认为 AGI 还需十年,目前算法有缺陷;强化学习虽有问题但必要;分析了 LLM 局限,探讨人类学习机制、AGI 经济影响等多方面内容。

AGI Hunt
开源动态8

表格理解新纪元!上交大等联合开源,半结构化表格问答准确率提升40%!

数据密集型工作中半结构化表格处理难,传统工具和GPT - 4o表现不佳。上海交通大学等联合开源ST - Raptor,通过VLM、HO - Tree算法和LLM推理,解决复杂表格问答问题,支持多格式,适用于多场景。

开源星探
产品应用8

98%财务顾问依赖AI,揭秘7家先锋企业如何解锁商业新格局

OpenAI报告剖析7家前沿公司应用AI经验。如摩根士丹利评估后让98%财务顾问用OpenAI;Indeed用GPT - 4o mini优化职位匹配;Klarna用AI客服助手提升效益等,展示AI重塑企业运营的潜力。

新智元
开源动态8

NeurIPS 2025 | 蚂蚁CGM:图融合架构重塑代码大模型,探索非 Agent 新范式

在NeurIPS 2025上,蚂蚁将展示Code Graph Model (CGM)。它把代码库图结构集成到开源LLM,开启新范式,在代码库级任务上以非Agent方案登顶开放权重模型榜首,解决了复杂软件工程的Agent依赖难题。

PaperAgent
推荐文章7

2026跳槽暴富指南:这些公司的期权,可能比你的年薪值钱10倍

2026年为中国科技公司IPO大年,众多公司上市后员工获丰厚收益。文章列举小红书、月之暗面等公司,分析其期权价值与上市可能性,给出评估期权的框架及投资风险提醒。

AI Reading Hub
算法论文8

邱锡鹏老师团队发布VehicleWorld:让智能汽车真“智能”

邱锡鹏老师团队发布论文,构建高度仿真的智能座舱虚拟环境VehicleWorld,并提出基于状态的函数调用(SFC)方法。实验显示,SFC大幅提升任务执行准确率和效率,还构建了Vehicle Benchmark进行评估

深度学习自然语言处理
开源动态8

76%程序员依赖AI?代码安全挑战解析

GitHub报告显示76%程序员用AI编程,代码安全成挑战。腾讯等团队建A.S.E评测框架,有项目级代码生成等优势,能评估代码安全、质量与稳定性,未来将扩充功能,邀开发者参与。

腾讯技术工程