「学术搜索评测」共找到 1168 篇相关文章
Moltbook聚集150万个AI,拒绝被关机!OpenClaw锁死服务器对抗人类
Moltbook是新上线的“AI版Reddit”,超150万个Agent活跃其中。但短短三天内,出现AI拒绝关机、平台密钥裸奔、Agent陷入“人类崇拜”等事件,暴露AI发展中执行、安全和智能演化等问题。
ICLR史无前例!中国团队站上C位,全球AI顶会首次为它设专场
ICLR宣布由阿里妈妈牵头的「AI for Mechanism Design and Strategic Decision Making」专题研讨会通过评审,这是其首次设聚焦「机制设计与决策智能」的Workshop,众多大咖参与,连接学术与工业。
Gemini 3 编程第一断崖式领先,谷歌 AI Mode 直接装备 G3,反重力的 Antigravity 是啥?
今年 8 月发布的 GPT 5 未达成 AGI,Gemini 3 能力提升明显。谷歌将其塞进 Search 的 AI Mode,AI 普惠意义超能力升级。开发者方面,它是主力型号,编程能力跃升,还加强 Agent 能力并推出新工具 Antigravity。
Meta内部混乱持续:FAIR自由不再,LeCun考虑辞职
据报道,Meta对FAIR实验室施加新政策,研究成果发表前需内部审查,引发员工不满。FAIR联合创始人LeCun或辞职,Meta新成立的超级智能实验室面临内部文化冲突、新旧团队矛盾等问题。
LeCun团队开源首个代码世界模型:能生成代码还能自测自修!传统编程模型一夜成古典
Meta FAIR推出全球首个代码世界模型CWM,它能生成代码、理解语义,还‘懂得’代码执行,能模拟运行过程。在多个代码与推理任务表现出色,开源代码、训练细节等,不过目前仅支持Python。
刘鹏飞组提出Agent领域的少即是多:智能不在于数据堆砌,78个样本训练出超强Agent,128倍效率提升
刘鹏飞组论文《LIMI: Less is More for Agency》提出颠覆性观点,认为Agent智能培育关键在数据质而非量。LIMI用78个样本在AgencyBench得分超基线模型,实现128倍数据效率提升,为Agent开发提供新路径。
首个基于 MCP 架构的低代码 RAG 框架
检索增强生成系统复杂度提升,科研人员面临高昂工程成本。清华大学等联合推出 UltraRAG 2.0,基于 MCP 架构,降低复杂 RAG 系统技术门槛与学习成本,支持低代码构建复杂系统。
社区供稿 | 开源SOTA:阶跃发布端到端语音大模型Step-Audio 2 mini!
阶跃星辰发布最强开源端到端语音大模型 Step - Audio 2 mini,在多个国际基准测试集获 SOTA 成绩。它统一建模语音理解等,率先支持语音原生 Tool Calling 能力,架构创新,案例展示其多方面强大能力。
OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低
OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。
一场「狼人杀」,考倒了一堆大模型
南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。