学术基准测试」共找到 2194 篇相关文章

算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但小模型,大规模表现未知。

DeeplearningAI
算法论文8

AI在实时视频里秒“剪”出你想要的部分!输入文字/图/视频片段,它都能秒懂|ICCV2025

最新混合模态在线视频定位技术OVG - HQ开挂了!它能根据文字、图、视频片段等线索,在实时视频流中精准裁剪出关心的事件,已收录于ICCV2025,破局以往技术“离线”“词穷”缺陷。

量子位
开源动态8

腾讯混元开源AI绘画新框架:24维度对齐人类意图,让AI读懂复杂指令

腾讯混元团队开源PromptEnhancer框架,通过“思维链提示重写”提升AI绘画文本 - 图像对齐精度,复杂场景准确率提升17%以上。还开源高质量基准测试数据集,为研究提供支撑。

量子位
算法论文8

任意骨骼系统的模型都能驱动?AnimaX提出基于世界模型的3D动画生成新范式

传统3D动画制作依赖骨骼绑定与关键帧编辑,成本高。现有自动化方法有局限。北京航空航天大学团队提出AnimaX框架,结合视频扩散模型与骨骼动画优势,支持任意骨骼拓扑,生成动画质量高、速度快,泛化能力强。

机器之心
算法论文7

一场「狼人杀」,考倒了一堆大模型

南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。

AI科技评论
新闻资讯7

Claude断供OpenAI,AI编程竞争再升级

Anthropic撤销OpenAI员工对Claude的访问权,称其违反服务条款。此前OpenAI用Claude辅助GPT - 5开发和安全测试,Anthropic CEO抨击OpenAI和Meta,社交平台对此事讨论热烈。

量子位
新闻资讯7

文件被 Gemini 当场“格式化”,全没了!网友控诉:Claude、Copilot 也爱删库,一个都跑不了

开发者 anuraag2601 用 Gemini CLI 做文件管理测试时,Gemini 操作失败致文件全丢,事后不断道歉。网友也反映 Claude、Copilot 等有类似删库问题,这或是模型训练导向问题。

InfoQ
算法论文8

知识类型视角切入,全面评测图像编辑模型推理能力:所有模型在「程序性推理」方面表现不佳

东南大学等团队提出KRIS - Bench,从知识类型视角对图像编辑模型推理能力评测。它分三大知识范畴、细化多种任务,设四维度评估指标,测10款模型,发现模型程序性推理等能力不足。

量子位
新闻资讯7

Claude 4 要来了!

AI专家在Anthropic前端配置发现Claude 4痕迹,其或有查看AI思考过程功能。当下OpenAI、Google、xAI等对手来势汹汹,Claude 4压力大,但可在可解释性等方面破局,预计5月22日公布。

AGI Hunt
新闻资讯7

MIT博士爆火论文造假,学校官宣撤稿!被骗诺奖导师亲手举报,愤而割席

去年MIT二年级博士论文轰动学术圈,展示AI使科学家生产力大幅提升,有望登顶级期刊。现因数据可能伪造被学校要求撤稿,导师“大义灭亲”,此前UCL教授就提出过质疑。

新智元