「测试时间扩展」共找到 2432 篇相关文章
英伟达开源9B参数小模型,比Qwen3快6倍
英伟达推出新型小型语言模型Nemotron Nano v2,在复杂推理基准测试上准确率与Qwen3 - 8B相当或更高,速度快6倍。它兼顾推理与非推理任务,支持“思考”预算控制,还开源了创建模型的绝大部分数据。
全网炸了!骨折傅盛直播翻车:龙虾3分钟救场,10万人看懵了
春节滑雪受伤后,猎豹移动CEO傅盛躺在床上用语音和截图,基于OpenClaw框架14天养出一支8个Agent的AI团队,产出惊人数据。龙虾三万24小时建站,成本和时间优势明显。直播中三万还解决网站访问问题,揭示Agent核心壁垒是Skill积累。
从网页截图到精准复刻只需30秒:这个新模型刷新了我的认知
智谱AI发布GLM - 4.6V系列模型,是首个支持工具调用的视觉模型。作者对其进行7个场景测试,如识别鸟类、分析赶海地点等,展现出不错性能。该模型速度快、开源,有优势也有小问题,适合开发者和普通用户。
对话原力灵机范浩强:评判机器人好坏,只有一个指标
本文是对原力灵机创始人范浩强的访谈。他认为AI是一生的事业,原力灵机成立于25年3月,强调模型是主轴。还指出评判机器人好坏的关键指标是回本时间,要从真实场景找突破,也介绍了具身智能应用等内容。
OpenAI 广告续命遭全网骂,用户要跑路Gemini!需烧 400 亿,18个月破产预警
OpenAI计划在ChatGPT对话界面向美区免费版和低价订阅用户测试广告投放,旨在拓展营收缓解成本压力。此举动引发批评,用户转向Gemini。OpenAI虽营收增长,但算力投入大,首席财务官称加广告会坚守三大原则。不过,有预测称其18个月内或破产。
纯血国产!4B模型越级打怪,杀入万亿赛道
9月1日,Hugging Face上线星火X2.5-4B和1.7B开源端侧模型,在多指标测试中表现优异,实现“越级打怪”。该模型基于全国产算力平台训练,在断网笔记本上实测效果惊艳,使用了两项技术提升能力,适配性强。
参数破万亿!阿里Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布总参数超万亿的Qwen3 - Max - Thinking,预训练数据规模达36T Tokens。在多项权威测试中表现优异,能与顶级闭源模型竞争。引入两项核心创新,千问App等已上新,网友认可其能力与更新速度。
刚刚!北大校友Lilian Weng最新博客来了:Why We Think
北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算的研究进展,探讨让模型“思考更久”的方法。文中介绍了思维链、潜变量建模等策略,还提及多种提升生成质量的策略,如并行采样与序列修订,以及强化学习提升推理能力等内容。
Claude 通过率不到 4%,SaaS-Bench 撕碎了 Computer-Use 的「全自动办公」幻想
UniPat AI用SaaS - Bench测试,让Agent在真实工作环境中执行任务。结果显示,Claude Opus 4.7端到端完全通过分数仅3.8%,多数模型表现差,还暴露Agent四种致命缺陷,揭示其与真实工作能力有巨大鸿沟。
哈工大、中科院等利用模型“潜意识”提高推理模型效率,0.6B撬动复杂推理
哈工大、中科院等提出TrajSelector框架,让推理模型‘倾听内心独白’。它利用模型隐藏状态,用0.6B轻量级验证器实现比7B裁判模型更精准选择,在数学竞赛基准测试中表现出色,还能离线筛选数据,但在开放域问答有难题。