大模型测试」共找到 9649 篇相关文章

开源动态8

Memento-Skills VS OpenClaw 不改模型也能进化

Memento - Skills让AI Agent自己设计自己,通过部署时学习进化,不动模型参数,将经验写进技能库。经测试,在HLE和GAIA基准测试中准确率幅提升,与OpenClaw等定位不同,有多种部署方式,不绑定模型

CourseAI
新闻资讯8

独家解读|2025年AI五趋势与底层数据革命

2025 年 AI 发展重心转移,高质量数据成新基石。本文解读五技术趋势,如多语种 TTS 与全双工交互、多模态模型等,还介绍了各趋势的数据需求及数据堂提供的相应数据服务方案。

机器之心
开源动态8

清华发布世界模型评测新标尺:直击机器人感知与行动鸿沟

清华学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示模型在感知与行动上的差距,转型为实用型模型是行业挑战。

AIGC开放社区
产品应用8

Agent、图像、视频全是版本升级:春晚还没开,豆包AI就火了

2026年AI市场竞争激烈,海外公司密集发布新模型致华尔街震动。国内腾讯、阿里、字节参战,字节官宣豆包参与春晚互动。2月14日火山引擎宣布豆包系列模型全面升级,含模型2.0、图像模型Seedream 5.0 Lite、视频模型Seedance 2.0。

机器之心
新闻资讯8

不只是DeepSeek V4,还有个万亿级模型,训推全程国产芯片

2026年4月24日,DeepSeek发布新一代模型DeepSeek - V4系列预览版并开源。同日,美团用全国产算力集群训练出万亿参数模型LongCat - 2.0系列预览版,训推全流程摆脱英伟达,在国产算力支撑万亿级模型研发上取得突破。

机器之心
算法论文8

用MoE打造DNA基础模型更强范式!人实现seq2func全新突破

中国人民学团队提出SPACE模型,通过引入物种感知编码器和谱系分组增强解码器,革新架构,提升了DNA基础模型性能与泛化能力,在多项测试中表现优于主流模型

新智元
新闻资讯8

中国AGI深度时刻!杨强、唐杰、林俊旸、姚顺雨咖们2026开年重磅交锋

2025年中国开源模型表现出色,AI模型探索新范式。AGI - Next前沿峰会嘉宾探讨AGI发展,指出模型To C与To B市场逻辑分化,还谈及自主进化、智能体变革及中国AI发展路径等问题。

AIGC开放社区
开源动态8

HF日趋榜一!真端到端模型AutoDeco终结手动调参解码

语言模型手动调参解码繁琐,腾讯AI Lab王琰团队联合港中(深圳)唐晓莹教授团队推出AutoDeco架构,通过创新训练策略让模型动态预测解码参数,在多模型实验中表现出色且已开源。

机器之心
算法论文8

英伟达发布 Jet-Nemotron 系列小模型,理论最加速比 56 倍

英伟达发布 Jet - Nemotron 系列小模型,在多项基准测试中表现出色,实现高吞吐量加速和高准确率。其训练采用 PostNAS 方案,对既有模型针对性优化,展示了在小模型优化上的可行技术路径。

AI科技评论
新闻资讯7

AI遭遇灵魂拷问!这道题所有模型集体翻车,网友:我也不会啊

图像推理现新难题,在Reddit引发热议,目前无AI能真正解决。国内外支持图像输入的模型答案不同,原因是对立方体规格理解不同。结合提示多次尝试,部分模型能找准方向,人类面对该问题也会困惑。

量子位