「基准测试成本」共找到 3429 篇相关文章
Anthropic将在两周内推出新思考模型!
据The Information报道,Anthropic将在未来几周推出Claude Sonnet和Claude Opus两款新模型,能在「思考」和「工具使用」间切换,还可自动测试纠正代码。虽此前产品有不足,但新模型处理复杂任务更出色。
14B检索能力超过Google Search,阿里ZeroSearch通过RL激发LLM检索推理能力~
有效信息搜索对提升LLMs推理和生成能力重要,当前RL方法有文档质量不可控和API成本高问题。阿里通义Lab提出ZEROSEARCH框架,经多步骤训练,实验显示其在检索能力和泛化性上表现出色。
梅涛的视频AI创业,最新产品来了
本文来自量子位,对梅涛旗下智象未来发布的AI视频创作智能体Vivago R1进行深度实测,介绍产品定位、技术架构,分析AI视频赛道分化路线,分享实测体验,探讨AI创作工具发展方向。
全球首个通用决策大模型,AI推演现实世界的技术揭秘
中科闻歌决策机Decitron被称为「全球首个通用决策大模型」,它将不同能力统一到开放世界决策框架,形成闭环。8月3日其技术报告发布,公开三项核心技术,还介绍了推演流程和实验验证情况。
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。
谢尔盖・布林再次进入「创始人模式」?Google押注「AI自我进化」
据路透社报道,Google联合创始人谢尔盖・布林深度介入AI研发,推动递归式自我改进(RSI)方向。此前Google新一代Gemini旗舰模型发布推迟,内部测试显示在关键领域落后对手,此次调整或为提升研发效率。
AI 怎么自我改进?Lilian Weng 的答案是:先写好Harness
提出 Agent 基本公式的 Lilian Weng 探讨 AI 递归自我改进,强调‘harness’重要性,介绍其设计模式、优化方法,还提及未来挑战与有用基准。如 harness 工程额外包含工作流设计等,优化方式多样但也面临评估器弱等问题。
大神周末开源省token野路子,claude fable5账单砍掉6成
外网大神周末开源插件,将模型上下文等渲染成图片,可让账单降低59% - 70%。原理是图片token只与像素尺寸有关。此前因模型识图能力差难落地,fable5证明其极限省钱且效果保留。
Qwen-AgentWorld:一个语言世界模型,模拟七大Agentic领域
今天正式发布 Qwen-AgentWorld,它是首个原生语言世界模型,能在七大领域模拟智能体交互环境。同步发布 AgentWorldBench 评测基准。Qwen-AgentWorld 经三阶段训练,在评测中表现出色,还探索两种范式增强通用智能体能力。
手机跑多模态也能快到飞起!面壁MiniCPM-V 4.6开源
面壁智能开源多模态模型MiniCPM-V 4.6,以低算力成本、超低首Token延迟打通三大主流手机操作系统。它算力瘦身性能强,是视觉语言多面手,还适配主流系统,降本增效,让AI能力从云端到指尖。