大模型测试」共找到 9676 篇相关文章

新闻资讯8

字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军

字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测中,Grok - 4夺冠。它从多网站构建问题,分四级难度。人类专家在部分等级仍领先AI 。

AGI Hunt
产品应用8

终于有AI视频模型,解决了体操难题。

前天深夜MiniMax发布Hailuo 02视频模型,虽未正式上线但放了预告片。该模型能生成杂技动作,解决了体操难题,在复杂动作肢体表现上吊打其他模型,还支持原生1080P,价格便宜。

数字生命卡兹克
算法论文8

DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角

DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。

AI寒武纪
算法论文8

清华&Qwen最新论文实证: VLM 智商与机器人操控能力“零相关”

清华和 Qwen 最新论文《VLM4VLA: Revisiting Vision - Language Models in Vision - Language - Action Models》测试 24 个 VLM 模型,构建极简 VLM4VLA 测试,发现 VLM 通用能力与机器人操控能力‘零相关’,还揭示视觉编码器短板。

深度学习自然语言处理
产品应用7

The Batch: 978 | DeepSeek-V4-Pro 更新了

DeepSeek发布旗舰模型DeepSeek-V4-Pro-0813正式版,性能提升,还发布开源agent harness开发者预览版并提价。模型在多指标表现佳,编码能力改进明显,公司公开基准测试框架意义

DeeplearningAI
算法论文8

「听觉」引导「视觉」,OmniAgent开启全模态主动感知新范式

针对端到端全模态模型痛点,浙江学、西湖学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在多基准测试中超越开闭源模型

机器之心
新闻资讯7

马斯克Grok-4卖货创收碾压GPT-5!AI卖货排行榜曝光,AGI的尽头是卖薯片?

新智元报道,「Vending Bench」榜单让模型经营自动售货机一较高下。Grok - 4卖货能力超GPT - 5,销量约高2倍,营收增31%。此测试揭示AI长周期决策挑战,引发AGI定义讨论。

新智元
新闻资讯8

性价比搏击:Grok 4 Fast 推理成本直降 98%

xAI上周五发布旗舰模型轻量化版Grok 4 Fast,推理成本直降98%。它通过强化学习在基准测试表现佳,有原生工具调用能力,采用统一架构,性价比高,或改写模型竞争规则。

AI科技评论
新闻资讯8

谷歌新架构突破Transformer超长上下文瓶颈!Hinton灵魂拷问:后悔Open吗?

谷歌在NeurIPS 2025发布两项模型新架构研究,通过‘测试时训练’机制,推理阶段可将上下文窗口扩展至200万token。新成果Titans和MIRAS结合RNN速度与Transformer性能,突破超长上下文瓶颈。

量子位
新闻资讯8

斯坦福临床医疗AI横评,DeepSeek把谷歌OpenAI都秒了

斯坦福最新模型医疗任务评测,构建含35个基准测试的MedHELM综合评估框架。结果显示,DeepSeek R1以66%胜率领先,o3 - mini等模型也各有表现,还分析了成本效益。

量子位