评估基准」共找到 1426 篇相关文章

开源动态8

256块NPU训成8B视频模型、超越Sora等一众闭源!抖音内容技术团队开源ContentV

近日,抖音内容技术团队开源ContentV,这是面向视频生成任务的高效训练方案。用256块NPU约4周训成8B参数模型,在多评估维度效果与主流方案相近,还探索了有限算力下训练路径,现推理代码与权重已开放。

机器之心
算法论文8

JCP | 南科大邹欣桐、王建春等:神经算子在三维湍流预测中的不确定度和稳定性分析

本文以三维各向同性湍流为例,提出面向神经算子的可信度评估框架,考察预测误差不确定度、长时迭代稳定性及流场时间相关性对模型可靠性的影响。结果显示,物理约束和合理时间步长可提升模型稳定性与可靠性。

力学与人工智能
产品应用8

AI × 老旧系统:Vibe Coding 构建 AI 迁移工具,实现 10x 端到端智能迁移

文章指出老旧系统现代化复杂且需大量人工,AI 编程工具和 Vibe Coding 带来新可能。介绍 6R 策略、绞杀模式等迁移方法,还阐述 AI 在系统分析评估、代码转换等方面的应用,最终目标是打造闭环 AI 迁移 Agent。

phodal
产品应用7

比 Context7 更靠谱:Exa-code 靠 1B+ GitHub 与 Stack Overflow 减少幻觉

Exa团队索引超1B+文档、GitHub仓库等内容,exa - code对其混合搜索、分块处理。它是首个为编码代理制作的Web规模上下文工具,在代码幻觉评估中表现超流行网页搜索工具,核心技术有专为AI的搜索引擎和高效返回上下文。

AI进修生
开源动态8

社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型

Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持单/多向量表示。介绍了架构、上手指南等。

Hugging Face
算法论文8

MSRA首测AI从零建仓库:能写、能跑,但不一定对丨ACL'26

微软亚洲研究院工作RepoGenesis被ACL 2026高分录用,它是面向多语言、仓库级、端到端Web微服务生成的基准。输入贴近实际,用多维度评测开源Agent和商业IDE,还拓展模型微调。但也有边界,未模拟真实复杂需求。

量子位
算法论文8

代码Agent的苦涩教训!首次拆解上下文检索,直指自动化软件瓶颈

ContextBench首次从「过程」评测代码智能体,揭示当前模型多读少用、被关键词误导等深层问题。它基于真实问题修复任务,由专家标注「黄金上下文」,用多指标评估。研究显示,复杂架构未必效果好,模型重召回轻精确等。

新智元
开源动态8

突破具身智能任务规划边界,刷新具身大脑多榜单SOTA,中兴EmbodiedBrain模型让具身大脑学会「复杂规划」

当前主流大语言模型在具身任务场景面临瓶颈,中兴星云大脑团队推出具身视觉 - 语言基础模型 EmbodiedBrain,构建全流程创新框架,在架构、数据训练、评估体系等方面有突破,还将开源成果推动生态发展。

机器之心
新闻资讯8

谷歌最新 Gemini Agent 爆击GPT-5.2?人类最后考试得分见分晓!网友:Altman又该发“红色警报”了

在全球人工智能竞争升温之际,谷歌与 OpenAI 同日更新。谷歌推出全新 Gemini Deep Research 工具,能力提升显著,还开源基准、推交互 API;OpenAI 发布 GPT - 5.2。两者竞争激烈,差距微小,都在争夺智能体框架标准主导权。

AI前线
算法论文8

用“因果规划”解决多智能体协作中的任务依赖难题|港科广&腾讯

港科广和腾讯研究团队提出CausalMACE方法,将因果推理机制引入开放世界多智能体系统。该方法含全局因果任务图,框架分“判断”“规划”“执行”环节,在基准任务中表现出色,已中稿EMNLP 2025 Findings。

量子位