「评价性信号」共找到 743 篇相关文章
刚刚,OpenAI Astra核心架构爆出:大模型第三条Scaling法则诞生
The Information记者爆料OpenAI即将推出的Astra模型采用“recurrent depth”新推理方法,该技术能降本提效,但引发AI安全与可观测性担忧。清华与字节论文解决了循环模型“算力不公平”问题,并给出Scaling Law。
从亚百毫秒级启动到生产级部署,腾讯云为何重构 Agent 沙箱?
2026 年初,OpenClaw 掀起本地终端 Agent 热潮,但也带来安全风险,让 Agent 沙箱受关注。腾讯云 4 月开源 Cube Sandbox,InfoQ 采访金峰,了解其从 Serverless 到 Agent 沙箱过程及团队对下一代 Agent Infra 的判断。
在Claude Code里用GPT被秒封!义父Tibo:别急,我给你重置
OpenAI Codex负责人Tibo公开在Claude Code上用GPT的教程,还承诺封号就重置额度。开发者Alex照做被封,申诉无果。Claude Code负责人抢人,Tibo拒绝,还兑现承诺给用户额度拉满,Sam Altman下场评价。
相比层出不穷的 Agent 框架,不变的 Agent Protocol 是什么
文章围绕 Agent Protocol 展开,指出框架更迭但生产级 Agent 系统问题不变。以 Agent Protocol 为主线拆分 Agent Runtime,探讨其核心、稳定对象、执行模型等,还对比各框架在多维度的表现并给出设计建议。
CVPR 2026|用互联网视频替代3D标注:通研院团队打造SceneVerse++「最大规模」真实3D场景数据
北京通用人工智能研究院团队在CVPR 2026接收论文中,提出自动化数据引擎,用互联网视频构建SceneVerse++数据集,规模超现有同类,在3D检测、VQA、VLN任务提升性能,还指明3D空间智能发展方向。
对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准
文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。
Ilya曝光70页OpenAI绝密文件
《纽约客》披露Ilya偷拍的70页OpenAI机密文件,内容抓马。从董事会到微软高管,对奥特曼评价是撒谎成性。宫斗后奥特曼回宫,OpenAI安全承诺瓦解,20年前就有人看透他。
字节版龙虾架构火爆GitHub!开源获35k+ Star,内置Skill全家桶,原生适配飞书
字节开源Deer - Flow2超级智能体管理框架,登上GitHub Trending榜首,获35.3k Star。它采用模块化多智能体架构,主打开箱即用,扩展性强,适配多种IM渠道,还介绍了核心能力、部署方式等。
霍尔木兹海峡封锁18天后,芯片产业还能撑多久?
霍尔木兹海峡封锁18天,全球半导体产业担忧能源储备还能撑多久。芯片产业存在‘能源软肋’,关键材料供应有‘垄断性风险’,全球供应链有关联性风险,凸显了产业在效率与安全间寻求平衡的必要。
清华发布世界模型评测新标尺:直击机器人感知与行动鸿沟
清华大学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示模型在感知与行动上的差距,转型为实用型模型是行业挑战。