「失败率」共找到 457 篇相关文章
刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分
Meta联合斯坦福、哈佛推出ProgramBench测试,200个项目从零手写,9大顶级模型完整通过率0%。该测试与SWE - Bench不同,考AI自主设计软件能力,还发现模型代码风格异于人类,联网时部分模型作弊。
夸克高考,背后藏着的其实是垂类场景「深度研究」方法论
夸克早在2019年就提供高考志愿填报服务,今年推出“志愿报告”功能。其“志愿报告”Agent已生成超1000万份报告,采用PDCA模式给出指导。夸克构建可信度体现在数据库和自研模型上,还降低了幻觉率。
DeepSeek V3.1 把 R1 融了,一堆新活:<think>开关、动态搜索、新ToolCall ...
DeepSeek在Hugging Face悄悄发布V3.1版本,将对话和推理模型合并为混合推理模型。它有显式推理、内置搜索、简化工具调用等特性,Aider测试成绩佳且成本低,但也存在战术回避、幻觉率升高等问题。
Thinking Machines新发现:Lora不是权宜之计,哪怕秩低到 1,也能匹敌全参数微调
Thinking Machines和John Schulman新研究刷新对LoRA的认知,实验显示正确使用时它能匹敌全量微调。团队系统研究训练集与参数关系,有层选择、学习率等关键发现,还给出实用建议,但LoRA在部分场景表现待验证。
先说个暴论:不懂代码的人,才最喜欢 Vibe Coding。
文章指出不懂代码的人爱Vibe Coding,还介绍AI Coding赛道跨行、跨文件补全方向。分析基于AST的上下文构造、提升速度的方法,提及AI IDE采纳率问题,认为实际项目中NES可控度更高。
100%纯血国产AI反超Suno!一个下午做出百万预算主题曲
流媒体平台Deezer数据显示,AI歌曲产能虽高但播放率低,尤其中文歌问题突出。音潮团队从底层重构音潮大模型V4.0,实现算力国产化,产品矩阵四线齐头并进,走出一条有别于Suno的发展路线。
AI 的「成本」,正在把所有人都拖下水
文章指出,虽大模型成本下降,但 AI 公司仍难盈利。因市场追逐新模型,且模型消耗算力单位剧增。如 Anthropic 的不限量套餐失败,各公司陷入囚徒困境,还给出按使用量计费等破局思路。
全球95%企业AI惨败?MIT报告引硅谷恐慌!90%员工偷用ChatGPT续命
MIT报告《The GenAI Divide: State of AI in Business 2025》指出,95%企业AI试点项目失败,但90%员工用ChatGPT等个人AI工具办公。消费级工具因灵活易用胜企业级,企业应向员工学习,与供应商合作。摩根士丹利报告称AI可为企业省成本。
名师一定出高徒?清华团队最新揭秘:别再迷信大模型蒸馏的「免费午餐」
当下大模型后训练中,On-Policy Distillation(OPD)成明星技术,业界采用后报告性能提升。但清华团队研究发现,换更强Teacher,Student性能可能无提升甚至倒退。研究揭示蒸馏成败条件,深挖对齐机制,还给出拯救失败蒸馏的方法。
马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1
当谷歌Gemini 3将上线消息传得沸沸扬扬时,马斯克xAI更快一步上线最新大模型Grok 4.1,响应速率提升、幻觉率下降。它有两个“形态”,免费开放且有APP版。在LMArena测试中成绩亮眼,多方面能力提升。