模型评测」共找到 7894 篇相关文章

开源动态8

Soul APP 开源首个 14B 实时数字人!0.87秒延迟+32fps,冲进 I2V 趋势榜 TOP5!

AI圈对数字人爱恨交加,因其存在太假、太慢、太僵硬等问题。Soul App旗下AI团队开源实时数字人生成模型SoulX - FlashTalk,参数量14B,有亚秒级延迟、高帧率等亮点,冲进HuggingFace I2V趋势榜TOP5。

开源星探
新闻资讯7

断层碾压Seedance 2.0:神秘「欢乐马」空降榜首,视频AI变天了

周二晚间,代号「HappyHorse - 1.0」的神秘视频生成模型在 Artificial Analysis 平台空降榜首,不论文字生视频还是图像生视频都排第一,拉开 Seedance 2.0 很大差距,不过在「视频 + 音频」综合排名上屈居第二,引发诸多猜测。

机器之心
算法论文8

RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈

大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。

深度学习自然语言处理
新闻资讯8

独家|「中科第五纪」完成数亿元A轮融资,率先开启海外商业落地

AI科技评论独家消息,具身智能企业「中科第五纪」近日完成数亿元A轮融资,年内已完成三轮。该公司还收获海外数亿订单。其提出超少样本具身操作大模型等核心技术,形成完整技术体系。

AI科技评论
开源动态8

Qwen3-VL-Embedding系列上新:探索统一多模态表征与排序

2025年6月曾开源Qwen3-Embedding和Qwen3-ReRanker,现推出Qwen3-VL-Embedding和Qwen3-VL-Reranker。它们基于Qwen3-VL构建,能处理多模态输入,在多任务达业界领先,还介绍了特性、评测及使用方法。

通义千问Qwen
开源动态8

首个故事可视化综合评估框架来了!80个故事单元53种类别,20种技术方案全面对比

随着AIGC技术进步,故事可视化引发关注。阶跃星辰携手上科大、西湖大学提出ViStoryBench可视化评估框架,通过构建多元化数据集、建立多维度评估指标,对超20种技术方案评测,为行业发展提供评估工具。

量子位
开源动态8

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26

当前图像编辑模型处理三维状态常出错。浙江大学ReLER团队提出并开源PhyEdit,用显式3D几何preview指导图像编辑,还加入深度监督,构建数据集和评测基准,成绩超Nano Banana Pro,且GUI也开源。

量子位
算法论文8

单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器

人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。

新智元
新闻资讯8

梁文锋、马斯克同时开火!DeepSeek V4 Pro,Grok 4.6 发布

刚刚,DeepSeek悄悄上线DeepSeek V4 Pro正式版,马斯克高调推出Grok 4.6,两者性能直逼顶级闭源甚至有超越。每百万输出Token,Grok 4.6和DeepSeek价格优势明显。两者在多项评测中表现出色,且后续还有大招。

AIGC开放社区
开源动态8

能让DeepSeek自进化的Harness!LlamaFactory作者开源新工具:0.2元自动造Agent

LlamaFactory作者郑耀威团队开源的PenguinHarness,是全球首个支持多Agent自进化的Harness,能自动构建、评测和改进Agent。它成本低、速度快,适配众多模型,还有严格契约保障安全。已在生产场景应用,效果显著。

机器之心