开源动态8
Meituan - M17团队:OIBench评测大模型编程能力
机器之心
AI 摘要
当前大模型编程能力评估体系有诸多问题,Meituan - M17团队推出OIBench数据集评测18个主流大模型,发现推理、闭源模型表现优,还计划举办人机协作编程竞赛推动技术发展。
阅读原文 · 机器之心
打破大模型编程「数据污染」与「能力虚胖」困境,Meituan-M17团队构建新一代AI编程评测新标准——OIBench
当前大语言模型编程能力评估体系问题多,如评测集饱和、数据泄漏等。Meituan - M17团队推出OIBench数据集,对18个主流大模型评测,揭示模型真实水平,还将举办人机协作编程竞赛。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
牛津、NUS 提出心智世界建模新方向
牛津大学和新加坡国立大学研究团队提出心智世界建模(MWM)通用框架,将心智变量纳入世界状态。还实现基准系统 MENTIS 验证其有效性,实验表明 MWM 对预测人类决策必要,瓶颈是状态转移模拟能力不足。
机器之心
新闻资讯7
DeepSeek V4 Pro 发布,撞车马斯克 Grok 4.6
周三晚间,DeepSeek 突然发布 V4 Pro 大语言模型正式版,命名为 DeepSeek - V4 - Pro - 0813,官方未调升 API 使用价格。有用户称调用的 V4 Pro 思维链风格有变,跑分显示其 Agent 评测表现可媲美顶级模型,还撞车了马斯克的 Grok 4.6。
机器之心
算法论文8
港校提出 Libra,Agentic RL 吞吐最高提 3 倍
大语言模型走向“完成任务”,Agentic RL 后训练让系统工作负载不稳定。港中文和恒生大学团队提出 Libra 资源管理系统,统一优化训练与 rollout,在多任务中提升吞吐,论文与代码已公开。
机器之心
算法论文8
TurboVLA:绕开LLM实现高效动作预测
近年来,VLA模型成通用机器人控制重要路线,但模型大、动作更新慢的矛盾凸显。华中科技大学联合华为提出TurboVLA,绕开大语言模型,形成V+L→A路径,降低成本,保持操作能力。
机器之心