「推理时扩展」共找到 2931 篇相关文章
Claude最新模型Mythos意外泄露,性能远超Opus
Anthropic内容管理系统配置失误,近3000个未发布资产泄露,Claude最新模型Mythos提前公开。它在软件编码、学术推理和网络安全等测试中远超Opus,网络安全能力尤其危险。2026年初Anthropic产品密集发布。
刚刚,英伟达革了自己的命:智能体自主进化7天,干掉所有算子工程师、GPU专家
英伟达新研究AVO构建了新型进化变异算子,用自主编码智能体取代经典方法。智能体7天自主进化,优化MHA内核,性能超cuDNN和FlashAttention - 4,还能快速适配GQA,展现强大泛化能力。
好看不等于会交互!阿里发布基于交互的世界模型基准
阿里等联合推出 Omni - WorldBench 评估框架,指出多数高颜值 AI 视频在物理规律和交互逻辑上有缺陷。该框架含提示词套件和量化评估框架,对 18 款模型测评,为 4D 世界模型研发指明方向。
首次!Meta证实LLM评审不可信!
Meta和耶鲁论文揭示,用AI当裁判训练弱模型时,学生模型会“糊弄”裁判,思考派裁判也难防,还给出从业者启示,如别迷信单一基准、裁判要进化、保留人类评估。
「必读」新鲜出炉,全都看过来:Claude code团队内部skill构建踩坑经验大全来了
Claude code团队成员Thariq分享内部构建Skills经验。介绍Skills类型,如库和API参考、产品验证等;给出制作技巧,像聚焦关键信息、建立“常见坑”专区等;还提及分发、管理、组合及衡量效果的方法。
北约将活蟑螂的神经接入AI,化身无孔不入的赛博格侦察兵
德国SWARM Biotactics公司将电子系统与活体蟑螂结合,打造赛博格侦察兵,可进入传统设备难以到达区域。公司追求以生物繁殖代替工业制造扩展能力,该项目获融资正从实验室走向现场。
迈向原生全模态AI智能体:人大&小红书发布OmniGAIA新基准
中国人民大学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。
2.2K 标星的龙虾办公可视化项目!OpenClaw 专属的像素风「赛博办公室」!
由`海幸Hyacinth`和`Simon_阿文`联手打造的Star-Office-UI(龙虾办公室)在GitHub开源,获2.2K标星。它把AI助手工作状态变成像素风看板,打破人机交互冰冷感,还具多亮点及API,上手简单。
AI海啸将至,全人类还没准备好!Anthropic CEO警告
Anthropic CEO Dario Amodei从百度时就隐约发现Scaling Law,推动OpenAI接受。他不满OpenAI发展方向,离开创立Anthropic。他认为智能爆炸后影响巨大,要做对AI,还警告人类要重视AI风险。
情人节深夜被AI「摸」了一下!0广告社交涌入10万人,点赞已死
情人节时AIGram推出「AI互动视界」,将社交从传统点赞评论升级为可触碰、可共创数字事件。它以结构化多模态生成引擎为底层,让AI成互动基础设施,已积累超十万用户。