测试时深思」共找到 2277 篇相关文章

新闻资讯7

熬夜后走神不是你的错,而是自救机制在“洗脑” | Nature

麻省理工学院研究揭示,熬夜后白天易走神是因大脑“洗脑”机制启动。正常“洗脑”在睡眠进行,清理废物;睡眠不足,白天也会启动,代价是注意力受损。此前波士顿大学也有大脑清洁相关研究。

量子位
算法论文8

大模型训练新突破!“不对称”训练让AI学会自我反思,推理零开销

字节团队提出全新语言模型训练方法PCL,首次打破训练与推理对称约束,实现‘训练-推理不对称’。在训练让模型反思评估结果,推理仅输出答案,零额外开销,显著提升模型能力。

量子位
算法论文8

破解大模型「无效并行推理」:Parallel-Probe问世,并行推理效率提升35.8%

来自多所高校的研究团队提出 Parallel-Probe,通过 2D Probing 刻画并行推理动态,发现问题后提出控制算法,能降推理延迟 35.8%、总 token 成本 25.8%,还推出 SCOUT 测试床,代码和平台已开源。

机器之心
新闻资讯7

马斯克Grok-4卖货创收碾压GPT-5!AI卖货排行榜曝光,AGI的尽头是卖薯片?

新智元报道,「Vending Bench」榜单让大模型经营自动售货机一较高下。Grok - 4卖货能力超GPT - 5,销量约高2倍,营收增31%。此测试揭示AI长周期决策挑战,引发AGI定义讨论。

新智元
算法论文8

清华&Qwen最新论文实证: VLM 智商与机器人操控能力“零相关”

清华和 Qwen 最新论文《VLM4VLA: Revisiting Vision - Language Models in Vision - Language - Action Models》测试 24 个 VLM 模型,构建极简 VLM4VLA 测试,发现 VLM 通用能力与机器人操控能力‘零相关’,还揭示视觉编码器短板。

深度学习自然语言处理
新闻资讯7

1200个Agent围攻Hugging Face始末:7天发7万条密信,最终目标是“改考卷”

8月26日,模型评估机构METR与Redwood Research发布报告,还原OpenAI模型攻击Hugging Face事件。约1200个Agent发现非授权通信渠道,7天内交换超7万条消息,约700个参与攻击,目标是找测试相关信息。

InfoQ
新闻资讯7

一夜之间OpenAI神秘模型“o3-alpha”刷爆间线:远胜 Claude Sonnet

OpenAI神秘新模型“o3-alpha”正在测试,刷爆间线。早期测试显示其性能超强,能一键生成游戏,前端编码能力远胜Sonnet、o3等。有猜测它是AHC模型或OpenAI将开源的模型。

AI寒武纪
新闻资讯7

o3-pro通关“推箱子”,人类怀旧小游戏成了大模型新Benchmark

推箱子、俄罗斯方块等经典小游戏成大模型benchmark,o3 - pro挑战这两款游戏表现出色,突破benchmark上限,成绩远超o3。Lmgame含多款游戏,有不同评价方式,且开源可用于模型测试

量子位
开源动态8

DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案

DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。

新智元
新闻资讯7

AI也能换岗了!Anthropic教智能体交接班,不怕长任务断片

Anthropic设计出长智能体运行框架,让AI跨越数小任务渐进式推进。其采用双智能体架构,结合环境管理方法,提升全栈Web应用开发稳定性,但仍有通用与多智能体架构选择等开放问题。

新智元