大语言模型评估」共找到 8253 篇相关文章

新闻资讯8

波士顿动力机器人终于有脑子了!人类故意使绊子也不怕

波士顿动力与丰田研究院联手基于大型行为模型,推出Atlas全新版本Atlas MTS。它能听懂自然语言指令、自主规划动作、处理意外。此次升级采用特定模型及策略,还结合VR界面。此外,波士顿动力转向电驱,电驱机器人时代将来临。

量子位
新闻资讯8

LLM近期重大架构进化一览:从Gemma 4到DeepSeek V4

近期大模型长上下文需求增长,成本问题凸显。Google Gemma 4、Poolside Laguna XS.2、Zyphra ZAYA1 - 8B、DeepSeek V4 等模型各有架构优化,如 Gemma 4 跨层 KV 共享和 PLE,以降低长上下文推理成本。

机器之心
算法论文8

代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈

ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。

新智元
新闻资讯7

The Batch: 883 | 美国两个州禁止人工智能驱动的心理健康治疗

美国伊利诺伊州成继内华达州后,第二个禁止用人工智能进行心理治疗的州。该法案限制聊天机器人独立治疗及其他AI使用方式,旨在保护患者和人类治疗师,但也引发对全面禁止利弊的讨论。

DeeplearningAI
新闻资讯9

Claude自主发现类CRISPR新酶系统,但还不知道它能干什么,张锋点评:值得研究

本文报道Anthropic旗下Claude大模型独立完成搜索分析,从噬菌体DNA中发现此前未被发现的类CRISPR新酶系统ART,展示了大模型在生命科学新发现中的独特能力,目前ART功能尚未明确,张锋点评其值得进一步研究。

DeepTech深科技
新闻资讯8

刚刚,DeepMind经典巨作再封神!ICML 2026大奖公布

ICML 2026大奖公布,杰出论文奖中两篇扩散模型论文获奖,立场论文奖指出AI安全工具被挪用问题。时间检验奖颁给DeepMind经典论文。获奖名单显示扩散模型研究热,AI安全需审视,AI研究进入深度清理阶段。

新智元
新闻资讯7

5Y News|GIM 完成数千万元天使轮融资

日前,GIM宣布完成数千万元天使轮融资,由五源资本与Monolith投资。资金用于自研金融大模型迭代等。其定位自进化智能体投资平台,已推自研金融时序大模型,未来将推基金策略与产品。

五源资本 5Y Capital
开源动态7

Wan2.2-Animate又火了,5分钟让抠脚大汉秒变高冷女神。

阿里开源模型Wan2.2 Animate又火了,用照片和视频就能生成换脸视频,表情动作复刻佳。它上限高,还能变声,可用于舞蹈视频、影视二创等,但手指易崩坏。模型开源,有积极意义也有风险。

数字生命卡兹克
新闻资讯7

GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍

Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。

量子位
开源动态7

Karpathy的编程经验Skills,开源了,Star涨疯了。

周末,Karpathy大佬的编程经验开源skills项目火了,它把其吐槽大模型写代码的问题编译成大模型可理解的约束。安装简单,还列举了一些规则示例。如今行业把人的经验编译成Agent可执行格式,开源范式改变。

探索AGI