「推理评估」共找到 2638 篇相关文章
苹果或搁置自研模型,转向依赖OpenAI或Anthropic
苹果正考虑用第三方AI模型驱动Siri,这是其在AI竞赛中的重大转向。目前苹果多为自研技术,评估外部模型项目已启动,虽未做最终决定,但或借此摆脱AI落后声誉。网友对此看法不一。
港科广等发布首个医学世界模型!精准模拟肿瘤演化,规划治疗方案
医学世界模型(MeWM)是创新AI系统,能模拟疾病演变、预测肿瘤变化,助医生术前评估治疗效果、优化方案。港科广等团队提出该模型,有肿瘤演变模拟等三核心贡献,在多方面实验表现佳。
Yann LeCun放出憋了20年的大招:Meta开源V-JEPA 2世界模型
Meta发布V-JEPA 2世界模型,参数高达10亿,推理速度比英伟达Cosmos快30倍。它基于Vision Transformer架构,是Yann LeCun倡导多年的JEPA路线成果,仅需62小时机器人数据训练就能执行任务,打脸质疑者。
对话蚂蚁吴伟:训推一体池化调度,如何把GPU用到极限
AICon大会前,与蚂蚁集团吴伟深度对话,探讨GPU资源调度解法。他指出CPU和GPU有结构性差异,只在推理或训练内优化有资源闲置,国产卡缺全链路生态,软件优化有天花板。还分享架构思路、算法及落地效果等。
一夜之间,AI终获「永久记忆」!最难考试99%刷爆SOTA,全网直呼疯狂
新智元报道,Supermemory团队推出超级记忆系统ASMR,在AI记忆界最难考试LongMemEval中刷到99%准确率。它抛弃传统模式,采用多Agent并行推理,4月初将开源代码。此外,其背后的Supermemory引擎功能强大,能让AI真正拥有记忆。
刚刚,OpenAI Astra核心架构爆出:大模型第三条Scaling法则诞生
The Information记者爆料OpenAI即将推出的Astra模型采用“recurrent depth”新推理方法,该技术能降本提效,但引发AI安全与可观测性担忧。清华与字节论文解决了循环模型“算力不公平”问题,并给出Scaling Law。
为什么 Agent Memory需要 AML:看 AML “变量控制”的工程设计
传统 Agent 记忆评测有水分,近日放榜的 Agent Memory Leaderboard (AML) 通过严格控制变量构建盲测管线。文章从技术架构深拆其工程细节,还分析了首期榜单,指出其重构评估变量的价值。
Fable 5解禁即翻车!写一行代码就降智,开发者破防
消失19天的Fable 5解禁即翻车,因过度审查和双标机制,让开发者破防。但抛开护栏,它执行复杂任务能力强。A社同期发布的Sonnet 5也遭群嘲,此外,A社还提出评估框架并向政府让步。
AI编程真面目:完整项目通过率仅27% | 上交大新基准
多校联合团队发布ProjDevBench,评估AI编程智能体端到端项目开发能力。结果显示,六种主流智能体总体提交AC率仅27.38%,从零构建任务中性能大幅下滑,还揭示了智能体多方面短板。
AI玩具和AI眼镜爆火,端侧市场或将超越云端?
当下AI难形成商业闭环,端侧AI或为落地答案。芯原股份戴伟民看好端侧AI市场,认为未来端侧推理需求或超云端训练,还指出AI眼镜、玩具、智能汽车等增量市场,同时介绍了芯原布局。