「FutureX 动态评测基准」共找到 975 篇相关文章
看遍奥斯卡后,VLM达到电影摄影理解新SOTA|上海AI Lab开源
上海人工智能实验室等推出ShotBench、ShotVL及ShotQA,ShotBench含超3.5k问答对,ShotQA约7万个问答对。ShotVL在ShotBench评测中表现出色,3B参数的ShotVL-3B增益达19.0%,超越GPT - 4o等。
万字长文!大模型LLM推理优化技术总结
文章围绕大模型LLM推理优化技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优化、模型优化和模型服务等技术,如Pipeline并行、MQA、量化、动态批处理等。
FairyGen:AI 把孩子的画“动”起来,个性化教育和动画创作
FairyGen 能将孩子画作变成卡通短片,通过多模态大语言模型构思分镜脚本,采用分层建模处理前景人物动作与背景动态。其生成流程分四阶段,但也存在前景角色重建不准、背景生成不稳定等问题。
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。
刚刚,DeepMind开源全栈「Deep Research」项目,AI 研究将人人可用
谷歌DeepMind团队开源基于Gemini 2.5的全栈「Deep Research」项目,能让每个人拥有智能研究助手。它可动态搜索、反思结果,以流式传输提供带引用答案,前后端结合,还介绍了特性、原理、技术栈等。
红杉中国推出 Agent 基准测试「xbench」,双轨评估体系,关注 AI 真实场景的效用
红杉中国开放AI和Agent基准测试工具「xbench」,采用双轨评估体系,构建多维度测评数据集。首期发布两个核心评估集并排名,提出垂类Agent评测方法论。该工具旨在解决现有评估问题,关注AI真实场景效用。
Transformer | 一文带你了解Embedding(从传统嵌入方法到大模型Embedding)
文章介绍Embedding基础知识,从传统统计方法到如今大模型用例演变过程。涵盖传统、静态、上下文及大模型Embedding技术,如TF - IDF、word2vec、BERT等,还剖析DS - Qwen1.5B的Embedding并以图展示。
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。
Generalist最新长文定调:具身原生才是正道,中国玩家原力灵机已交卷
Generalist创始人Pete Florence团队释出GEN-1技术博客,否定世界模型与VLA之争,强调具身智能应回归目标,主张从零训练。中国原力灵机DM0也采用具身原生路线,在RoboChallenge评测中成绩优异。
OpenAI新模型Day0就被嫌弃!排名拉垮,不如一月底发布的国产模型
OpenAI推出GPT - 5.4 mini和nano模型,主打快速经济,针对编程等优化。但评测中GPT - 5.4 mini排名不佳,不如国产Kimi 2.5,且价格对比有争议。不过与自家旧版比有提升,网友测试有亮点。