「算力评估」共找到 1471 篇相关文章
微软开源Skill训练框架,让Agent白天干活,晚上自动复盘,Skill的自进化终于可监控了
微软开源SkillOpt v0.2.0,加入SkillOpt - Sleep让Agent可自我复盘。该文本空间优化框架能自动训练和优化skill,有透明化、质量控制等特点,适合重复、可评估任务场景。
「AI 100」榜单启动招募,AI产品“年会”不能停丨量子位智库
2025年国内AI产品领域涌现诸多关键词,对应多款颠覆性产品。量子位智库2025年度「AI 100」榜单开启招募,分三大板块,采用定量与定性结合评估体系,还公开国内AI产品知识库。
刚刚,马斯克收购了马斯克
SpaceX 宣布收购 xAI,合并后公司估值达 1.25 万亿美元。此举旨在打造宏伟创新引擎,将 AI 与航天等技术结合,利用太空资源满足 AI 算力需求,推动人类太空探索与发展。
xAI工程师播客聊太嗨,马斯克解雇了他
xAI工程师Sulaiman Ghori在播客上透露诸多公司内部细节,如MacroHard技术路线、算力部署方案等,后被解雇,引发网友猜测,其内容或为行业带来启发。
「AI 100」榜单启动招募,AI产品“年会”不能停丨量子位智库
2025年国内AI产品领域涌现诸多关键词,对应多款颠覆性产品。量子位智库2025年度「AI 100」榜单开启招募,分三大板块,采用定量与定性结合评估体系,还公开自研AI产品知识库。
The Batch:831 | 机器翻译正在实践中发挥作用
人工智能为语言学习应用巨头 Duolingo 带来生产力提升,借助生成式 AI 构建 148 门课程,总量翻倍。其 AI 辅助课程构建法能快速转化多语种版本,还在评估多模型,不过此举也引发批评。
2025年的冬天,上海凭什么被称为“世界具身智能第一战场”?
2025年上海或成“世界具身智能第一战场”。上海构建服务型政府生态,开放场景、平权算力、建设语料、集聚产业。企业完成蜕变,政策催生技术突变,12月12日GDPS大赛将是成果“实弹演习”。
首个英文原生「弱智吧」!逻辑谬误数据集与生成框架来了 | AAAI'26
研究发现大模型判断逻辑谬误易误报正常句子,但分类能力较强。研究人员构建英文逻辑谬误基准SMARTYPAT - BENCH,开发生成框架SMARTYPAT,为大模型逻辑评估提供新思路,可用于多领域。
研究表明,开源能推动AI创新和经济增长
Siliconangle消息,Linux基金会新研究显示开源对全球经济贡献达9万亿美元。其首席经济学家Frank Nagle指出,AI加入使开源价值评估方式改变,计算开源AI价值复杂,参与开源项目能增加经济价值。
正确答案 ≠ 正确推理,CoT 或成大模型推理能力停滞的「罪魁祸首」?
研究指出当前大模型推理能力评估多关注答案准确性,忽视推理步骤。通过对前沿模型测试发现,2023 - 2024 年大模型推理能力提升停滞,进步靠提示工程,自底向上策略最有效。