「效率提升」共找到 3467 篇相关文章
ACL 2025 Oral | 你的模型评测搭子上线:Evaluation Agent懂你更懂AI
上海人工智能实验室与新加坡南洋理工大学合作研发 Evaluation Agent,它能按需评估视觉生成模型,有可定制、高效率等优势。框架分提案和执行两阶段,评估结果佳,未来将拓展功能。
正确答案 ≠ 正确推理,CoT 或成大模型推理能力停滞的「罪魁祸首」?
研究指出当前大模型推理能力评估多关注答案准确性,忽视推理步骤。通过对前沿模型测试发现,2023 - 2024 年大模型推理能力提升停滞,进步靠提示工程,自底向上策略最有效。
杭州再出王炸!医疗影像黑马德适推出iMedLoop:打通医疗AI全链路
7月4日,德适科技发布iMedLoop,它是医疗影像数据合规协同平台,打通医疗AI全链路。其基于iMedImage、iMedStudio和iMedMaaS搭建,让医疗AI转向“轻量化、高效率”,已积累大量数据和模型。
你的 Harness 工作流真的在进步吗?我们用一场考试撕掉了遮羞布
文章指出Harness工作流常靠‘主观vibes’驱动,缺乏有效评价体系。为此推出Harness Eval评测系统,包含出题、答题、改卷等环节,形成闭环,帮助工作流持续改进,还能提升整体通过率。
给AI全局记忆
作者认同OpenAI‘全局记忆’观点,称其能提升对话连贯性,实现AI成个人助理愿景。介绍OpenMemory项目可存储调用记忆,还提及实现功能的三点做法,看好创业者在该领域机会。
刷榜只是体力活!清华消费10万块,一周「肝」出105个SOTA
AutoSOTA通过多智能体协作,将AI研究中繁琐的性能优化过程自动化,使科研从「手工艺」转向「工业流水线」。在一周压力测试中,消耗约10.4万美元,发现105个SOTA模型,平均性能提升近10%。
走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则
文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。
智谱GLM-5强调的Agentic Engineering能力是什么?|甲子光年
智谱上线并开源GLM - 5,在Coding与Agent能力上达开源SOTA,刺激股价上涨。它验证了Agentic Engineering可行性,提升能力阈值,但成本阈值也更显性,未来软件工程或分层发展。
2025-2027年DRAM、NAND市场及价格走势分析
文章分析2025 - 2027年DRAM、NAND市场走势。DRAM因AI需求价格涨,供需缺口大,DDR5将成主流;NAND需求结构性增长,产能利用率提升。技术革新不断,中国厂商崛起,地缘政治影响格局。
美国程序员失业率创纪录:17万本科生难就业,AI抢饭碗!
《纽约时报》《路透社》发文指出,美国计算机专业毕业生失业率创新高。高盛经济学家称,ChatGPT等AI工具降低企业对IT人员需求,OpenAI新模型更甚。专家认为毕业生应将AI当帮手提升技能。