「超长上下文测试」共找到 2297 篇相关文章
全球首个多模态矢量动画生成框架,轻松拿捏跨平台轻量动画
复旦大学等团队推出OmniLottie框架,利用创新分词技术将视频、图文指令变成高质量矢量动画。团队还打造数据集MMLottie - 2M,构建测试基准MMLottie - Bench。实验显示,OmniLottie在多任务测试中优势明显。
「0污染」LLM理解基准来了!20000道题14个学科全覆盖,来自微软
MMLU-CF是微软亚洲研究院推出的无污染多任务语言理解基准测试,含20000道题、覆盖14学科。通过去污染规则和闭源测试集防数据泄露,保证评估结果可靠,已在Huggingface开放。
轻量级开源AI多智能体框架!智能路由+上下文管理,前后端接口支持!
随着多智能体系统成对话式AI新趋势,GitHub现轻量级高灵活性多AI智能体协调框架Agent - Squad,它能实现多智能体协作、路由和上下文共享,支持双语言,部署灵活,功能强大且安装友好。
ICML 2025 | M+框架来了,增加LLM隐空间记忆,不再受上下文窗口限制
本文提出M+长期隐空间记忆扩展框架,在MemoryLLM之上,将8B级模型有效记忆跨度从不到20k提升到160k+,显存占用不变。它解决了现有记忆模型冗余、冲突难解等问题,为下一代语言模型提供支撑。
多模态模型具备“物理推理能力”了吗?新基准揭示:表现最好的GPT-o4 mini也远不及人类!
来自多机构研究人员构建PhyX基准测试,评估多模态模型物理推理能力。测试显示,即便表现最佳的GPT - o4 mini准确率仅45.8%,远不及人类的75.6%,且模型在多方面存在结构性缺陷。
刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代
OpenAI正式发布GPT - 6 Astra和GPT - 6 Astra Pro,宣布AGI时代开幕。该模型训练规模大,能力升级显著,价格公布。基准测试成绩优异,在多方面表现突出,还展示诸多实际应用案例,已有企业开始测试。
单卡搞定万帧视频理解!智源研究院开源轻量级超长视频理解模型Video-XL-2
智源研究院联合上海交通大学等机构发布新一代超长视频理解模型Video-XL-2。它单卡能处理万帧视频,编码2048帧仅需12秒,在效果、长度和速度上全面优化,已开放模型权重。
不让“猪队友”拖后腿!哈深新作 AgentDropoutV2,专治多智能体“传话游戏”翻车现场
多智能体系统中,常有agent出错带偏整体。哈工大联合阿里提出AgentDropoutV2,测试时介入,设‘质检员’审核输出,结合失败案例构建‘避坑指南’,在多测试中显著提效,泛化性强。
OpenAI深夜放出GPT-5狙击谷歌!基准测试碾压前代模型,价格比Claude更便宜
北京时间8月8日凌晨,OpenAI推出GPT - 5,宣称其更智能、准确,幻觉率低。还推两款新模型,介绍了不同用户套餐。它在编程基准测试表现佳,健康领域能力突出,引发各界热议。
图像编辑模型不止生成:BIGAI&上交大提出EAR范式,系统测试其视觉规划能力
上海交通大学联合北京通用人工智能研究院提出EAR范式,构建AMAZE基准,分析图像编辑模型视觉推理能力。研究发现模型零样本表现弱,扩散式模型更适合视觉规划,CoT效果不稳定等。