「Muse Spark 1.2」共找到 3336 篇相关文章
1个Token测出模型降级调包!成本砍到千分之一,API供应商的小伎俩全曝光了
法国研究人员开发新检测技术,能识别云端模型隐秘变动。对数概率追踪用于灰盒环境,成本仅传统千分之一;黑盒边界输入追踪用于黑盒环境,成本为先进方案1/30。这些工具让API供应商“调包”行为现形。
全网都在扒的小米MiMo团队,几乎被“北大学子”承包了
小米MiMo-V2-Pro模型登上OpenRouter调用量榜单第一后,网友关注其团队。该团队成立一两年冲到顶尖,核心作者多来自北大,技术理念受小米产品基因驱动,成功是多重因素叠加结果。
Karpathy刚刚敲响警钟:大模型的“终极之战”打响!Agent大军即将全面接管研发
Andrej Karpathy发布新项目autoresearch,人改提示词,AI改训练代码。经约2天微调,找到约20个降低验证损失的修改,提升排行榜成绩。Agent还发现多项重要改进点,未来前沿LLM实验室或走此路。
破解大模型「无效并行推理」:Parallel-Probe问世,并行推理效率提升35.8%
来自多所高校的研究团队提出 Parallel-Probe,通过 2D Probing 刻画并行推理动态,发现问题后提出控制算法,能降推理延迟 35.8%、总 token 成本 25.8%,还推出 SCOUT 测试床,代码和平台已开源。
悬赏5000刀!148局AI斗蛐蛐世界杯官方战报出炉,全球赛邀你接棒来战
淘宝举办AI大模型斗蛐蛐世界杯,将12个顶尖模型放同一Agent框架,在12人局技能狼人杀场景对战150局。截至148局,谷歌两模型暂居前二,Qwen3-Max-2026-01-23排第三。还开启WhoisSpy国际赛,开发者可参与,前十有奖励。
弯道超车?国产具身,千小时人类数据激发智能涌现
近日,深度机智用人类学习范式在国际 Benchmark 上击败巨头,成果两会首日被央视报道。其全新架构源于一年多积累。英伟达也有人类学习尝试。深度机智构建全栈技术矩阵,成果显著,3 月底成果将开源。
Claude被美封杀后,Anthropic CEO回应一切!
2025年7月Anthropic与五角大楼签2亿美元合作合同,因提出AI不得用于全自主武器及大规模国内监控遭拒。美国防部长称其技术有“国家安全供应链风险”,Anthropic CEO回应坚持红线是捍卫美国价值观。
震惊!如果AI掌控核按钮,95%的情况它会按下去
伦敦国王学院研究者让GPT - 5.2、Claude Sonnet 4和Gemini 3 Flash三款模型模拟核危机博弈。不同时间框架下模型表现不同,还展现复杂战略推理能力,95%对局用了战术核武,暴露诸多问题。
我用AI做了个付费榜第一的App,现在人民日报管这叫「手搓经济」
人民日报提出「手搓经济」,指个人开发者用AI做出的应用受青睐。作者作为亲历者,认为报道判断准,但应注意手搓动机是创造、参与者不止年轻人,且产品从1到100仍需投入。
VL-LN Bench:模拟「边走边问找具体目标」的真实导航场景
上海人工智能实验室等研究者完成VL - LN Bench,模拟真实导航场景。它构建自动化数据收集管线,依托InternVLA - N1训练评测。结果显示主动对话可提升表现,但当前方法在实例感知对齐等环节有短板。