「观测的暴露度」共找到 10530 篇相关文章
首个面向科学任务、真实交互、自动评估的多模态智能体评测环境,ScienceBoard来了
ScienceBoard是首个面向科学任务、真实交互、自动评估的多模态智能体评测环境。它集成多领域科研软件,构建科研任务集合,评估智能体在科学任务上的表现,发现现有模型在科研工作流中远未成熟。
马斯克点赞的APP来了!刚下场视频世界模型,就拿下评测第一
实时视频世界模型成热门,Loopit发布的实时互动世界模型Zing - 0.5在评测中获第一且已开源。该公司提出独特观点,认为实时视频非世界,互动应“模应一体”,还指出抵达端到端终局的新路径。
GPT-5通过“哥德尔测试”!独创性解决博士生都得花几天时间的开放数学问题
最新论文中,研究人员让GPT - 5挑战5个未解决的优化猜想,它解出3个,还对一题给出不同有效证明方案。测试题需博士水平研究者花几天完成,研究还“挑衅”了陶哲轩对大模型数学能力的印象。
从 AI 取数到智能分析:企业级数据 Agent 的多阶段演进与工程化落地
文章整理自 Shopee 技术专家王新波在 QCon 全球软件开发大会 2026 北京站的分享。复盘团队打造企业级 Data Agent 实践,揭示技术演进路径,分享将取数工具雕琢为智能分析工具的方法。
对话唐波 x 伍斌:OpenClaw 最强的地方,为什么也成了它最大的短板? | AI 进化论
本文聚焦 OpenClaw 引爆的智能体革命,对话专家探讨记忆系统及下一代 Agent 走向“长期主义”的底层逻辑。指出 OpenClaw 记忆起初是优势,后成短板,还讨论了从“记住”到“会用”、多 Agent 协作等问题。
龙虾安全被3层硬核架构焊死了!一份面向开发者的硬核生存指南
随着OpenClaw等高权限智能体应用爆发,AI自主性与失控的赛博博弈开启。文章从源头对齐、边界重构、结果保障三个维度,拆解适应智能体自主行动时代的新型安全框架,为开发者提供生存指南。
超强开源OCR,手写体识别能力超dots.ocr,封存多年的老文档数字化有救了。
文章推荐新开源的OCR系统Chandra,它对手写体识别做了优化,官方测评数据显示比dots.ocr强。介绍其适用于多场景及功能特点,还展示了不同场景的识别效果,建议有需求者多对比测试。
CUTLASS CuTe GEMM细节分析(三)——Swizzle<B, M, S>模板参数的取值
文章以(8, 32):(32, 1)为例,探索确定Swizzle<B, M, S>中M、S和B参数的方法。指出M、S与PTX指令及共享内存多Bank结构相关,B用于指定Swizzle行数避免bank conflict,还给出不同Layout的参数取值。
对话 Ribbi:所有人都在做创作工具,我们在做一个有品味、会进化的「人」
在AI创作工具扎堆的2026年,多数产品仍聚焦单一环节。Ribbi创始人Robin认为,AI时代内容创作应是接管全链路、懂品味、会进化的“人”。Ribbi以场景化Skill覆盖全流程,解决多痛点,实现自主进化。
对话光帆科技董红光:Manus 让 Agent 走红,但真正的 AI 载体不只有手机
本文是对光帆科技创始人董红光的专访,围绕AI时代的交互与硬件趋势展开。董红光认为AI最合适载体非手机,光帆发布全球首款视觉感知AI耳机,介绍了产品设计原理、操作系统研发等,并探讨了AI硬件市场现状与未来。