「数据挑战」共找到 3370 篇相关文章
GPT-5.4 仅 11.36%!当大规模工具生态变成迷宫,LLM Agent 还能完成长程规划吗?
PlanBench-XL 来自 UIUC 团队,将 LLM Agent 放入零售 API 世界,评测其长程规划能力。它考虑真实工具环境挑战,含 327 个任务等,发现多数模型规划难、恢复差等问题,并给出改进启示。
用户太蠢不配用 Fable?被Anthropic的回应气笑了:最贵的模型,最憋屈的体验
Anthropic推出Fable 5,有限时优惠但价格贵,新回退机制引争议,很多请求被降级。其曾强调安全,却用隐蔽方式编码用户信息,引发开发者不满,与OpenAI竞争也面临挑战。
Headroom:Netflix 工程师开源的上下文压缩工具,省 token 还是烧 token?
Netflix工程师Tejas Chopra开源Headroom,定位为AI Agent的上下文压缩层,压缩工具输出等内容,有可逆压缩等特性。官方数据显示节省token效果好,但微软工程师实测结果中性偏负面。
刚刚,翁荔博客上新:谨慎对待Scaling Law
翁荔新作《谨慎对待 Scaling Law》上线,文章涵盖 Scaling Law 预测内容、计算最优分配原理等。介绍了早期对机器学习损失可预测性的研究,还对比了 Kaplan 等人与 Chinchilla 的 Scaling Law,分析了两者分歧原因。
世界模型混战,Momenta率先冲刺IPO
当下世界模型是AI领域热门且混乱的概念,主流路线有四类。Momenta的R7世界模型已量产,其CEO定位公司为物理AI基座模型构建者。Momenta率先冲刺IPO,商业模式正转型,为后续玩家提供价值评估体系。
7,700+ star 微软 SkillOpt 可以训练的Skill
微软研究院开源了SkillOpt(7700+ star),把Skill文档当成‘可训练的权重’来优化。它有独特的6阶段流水线、核心验证门控、Protected Regions机制,还有SkillOpt - Sleep预览功能,让Skill文档可系统化训练。
ICML 2026|表格异常检测能否告别「one-for-one」?OFA-TAD迈向one-for-all通用异常检测新范式
表格异常检测在多领域作用关键,但当前 one-for-one 范式成本高、泛化弱。Griffith 和同济团队提出 OFA-TAD,推进到 one-for-all 范式,在多源数据集训练一次即可迁移,实验表现优异。
Anthropic发布AI原生创业秘籍:手把手教你怎么烧Token创业
Anthropic发布36页AI原生初创企业操作手册,将创业精准拆解为四阶段,剖析如何用Claude Code构建商业护城河。介绍各阶段任务、退出条件、常遇问题及应对策略,强调创始人判断能力重要性。
马斯克暴走官宣:Grok 5就是AGI!五月连轰两代万亿怪兽,OpenAI慌了
马斯克宣称Grok 5就是AGI,5月将连发1T和1.5T两代万亿参数模型。Grok 4.3已上线,4.4、4.5将相继推出,Grok 5正以6万亿参数规模训练。不过,参数能否堆出AGI存争议。
白春礼:人工智能促进科学研究范式变革
白春礼在浦江论坛探讨AI对科研范式变革的影响。他指出,当下科学研究体系面临发现机制、组织方式、知识生产方式的结构性重组,呈现新特征,同时也面临竞争、组织变革等挑战。