基准测试集」共找到 2447 篇相关文章

算法论文8

让大模型“吃一堑长一智”,南理工百度等提出模型记忆新方法

南京理工大学联合百度等提出新方法ViLoMem,构建视觉流+逻辑流的双流语义记忆,让模型“从错误中学习”。它能在多模态基准提升模型表现,强模型记忆还可迁移给小模型。

量子位
新闻资讯7

GPT-5.2已上线24小时:差评如潮!

OpenAI 十周年推出号称强大的 GPT - 5.2,却差评如潮。它在 SimpleBench 测试结果不佳,回答不稳定,编程和艺术创作效果差,情商低、不通人性,审查和安全拒绝机制也饱受诟病。

机器之心
算法论文8

Yann LeCun离开Meta后首篇论文?使用了宇树机器人做研究

伯克利、纽约大学等团队发表论文,提出GenMimic方法,让机器人能零样本复现AI生成视频动作。Yann LeCun是共同导师之一。团队构建GenMimicBench数据,经仿真和真实实验验证方法可行。

机器之心
开源动态8

比Gemini 3记得更多,谷歌新框架将上下文记忆干到了200万!

Google在NeurlPS2025大会推出结合RNN与Transformer的全新架构Titans,能扩展到超200万个token上下文。背后涉及Titans和MIRAS两篇论文,共同推进测试时记忆概念,实验显示新架构性能出色。

PaperAgent
开源动态8

AI地理学家诞生:麻省理工、斯坦福用多智能体框架重塑地理空间建模,刷新SOTA

麻省理工、慕尼黑工大及斯坦福AI实验室发布GeoEvolve框架,深度融合地理知识与进化算法,实现复杂地理空间模型自动发现与优化。经实验验证,其性能超越以往基准,有望在多领域发挥作用。

AIGC开放社区
开源动态8

Identity-GRPO:阿里开源多人物定制化视频生成的后训练优化算法

阿里团队提出Identity - GRPO算法解决多人物视频生成身份一致性问题。构建约15000个标注样本数据,基于Qwen2.5VL设计奖励模型,多项策略增强训练稳定性,实验验证性能提升显著。

PaperAgent
产品应用8

实测谷歌AI故事书,我实现漫画和绘本自由了

谷歌Gemini推出免费StoryBook工具,30秒左右可生成10页故事书,支持中文且内容有趣。测试显示,它在图像风格、故事创作上表现出色,还能作学习和展示工具,获网友好评。

量子位
开源动态8

Index-AniSora:B站开源动画生成模型,斩获多项SOTA入选IJCAI25

B站开源动画视频生成模型Index - AniSora,支持多种二次元风格视频镜头一键生成。基于AniSora系统,全面提升动画生产效率与质量,开源内容丰富,还构建奖励数据和奖励模型提升对齐性能。

机器之心
开源动态8

DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude

DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。

AIGC开放社区
产品应用7

在 RDS PostgreSQL 中实现 RaBitQ 量化

本文介绍在阿里云 RDS PostgreSQL 上,pgvector 能力进一步增强,引入 RaBitQ 量化提升其在大规模向量场景下的表现。分析了 pgvector 面临的挑战,阐述 RaBitQ 原理、优势,给出性能测试结果及快速上手的 SQL 操作。

阿里云开发者