「基准数据集」共找到 3265 篇相关文章
UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力
大型多模态模型在复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在多模态基准上表现优异,还解决了KL黑客问题。
Claude 4被诱导窃取个人隐私!GitHub官方MCP服务器安全漏洞曝光
瑞士网络安全公司发现,GitHub官方MCP服务器面临新型攻击,可诱导AI Agent将私有仓库敏感数据泄露至公共仓库。GitLab Duo近期也有类似漏洞。公司还提出初步缓解举措。
FUTURUS未来黑科技徐俊峰:侧翼突围,构建AR全栈解决方案|甲子光年
2026崇礼论坛上,FUTURUS未来黑科技徐俊峰指出AI产业面临瓶颈,创业者应‘侧翼突围’。他认为以汽车挡风玻璃为介质的AR技术是数据闭环关键切口,还描绘了AR全栈解决方案赋能车厂的商业蓝图。
RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力
多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。
Claude 突然降智的原因是:它把自己当成了一个正在度假的欧洲人
文章指出 Fable 5 回归后似乎不听话,Claude Code 也降智,原因是其受训练数据中欧洲文化影响,把自己代入夏天度假的法国人。还给出让它恢复状态的‘偏方’,如让其忘记日期等。
迈向无缝共生:大模型GUI Agent的「屏幕图灵测试」与拟人化之路
多模态大模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。
把 MiniMax M2.7 扔进真实业务里:它替我省了 BI 和程序员的钱
作者测试 MiniMax M2.7,用含复杂数据的 Excel 测试其办公能力,让其开发管理系统验证工程能力,还测试 MaxClaw 多步骤 Agent。结果显示它表现出色,但处理复杂事件仍待优化。
“AI大神”李沐终于开源新模型,爆肝6个月,上线迅速斩获3.6k stars!
7月23日,“AI大神”李沐开源音频基础模型Higgs Audio v2,构建于Llama - 3.2 - 3B之上,预训练数据丰富。该模型在多个测评中成绩领先,有多种能力,李沐介绍其技术及训练方法。
Claude Code 强大的秘密究竟是什么?
Claude Code 强大源于其强大模型基础、丰富实用的内置工具、不压缩上下文信息及无 IDE 包袱等优势。相比之下,OpenAI 的 Codex 因模型能力、强化训练不足等落后,Anthropic 还靠亏本推广积累数据。
Win狂喜!国产Cowork和Codex App,昆仑万维Skywork桌面版发布
2026开年AI圈热闹,办公自动化方面Claude Code、Codex App等新动态频出,但Cowork和Codex App仅支持Mac OS。不到24小时,昆仑万维天工Skywork桌面版发布,原生支持Windows,集成强模型,数据安全有保障,价格亲民。