「测试平台」共找到 2960 篇相关文章
我给 Claude Code 加装了 MiniMax M2.5:它像“法拉利”,但更像一台工作机
作者给 Claude Code 加装 MiniMax M2.5 模型,测试其编程、上下文记忆等能力。M2.5 在多方面表现出色,能高效完成各类开发任务,还具备良好的中文处理能力,性价比高。
离职程序员深夜忏悔用“绝望指数”算法害人:Uber Eats剥削外卖员让缺钱者狂接垃圾订单!如今竟被爆帖子是AI编的?网友:别再让AI背锅了
Reddit一用户自称Uber Eats离职工程师,爆料平台用“绝望指数”算法剥削外卖员,帖子传播极广。但记者核实发现是编造,“证据”或由AI生成,网友对此调查结论看法不一。
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。
Meta提出数据筛选的理论:何时“少即是多”成立?
Meta针对机器学习领域‘少即是多’悖论提出理论框架,用高维统计等方法推导测试误差缩放定律,揭示数据筛选‘相变’条件,为实践提供指导,还重新定义‘数据效率’意义。
北航LiveRepoReflection: 扭转乾坤-仓库级代码反射
本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。
又一个Kimi K3下周开源!Qwen3.8-Max编程、办公、科研都能自己干了
Qwen3.8-Max是Qwen家族迄今最强模型,2.4万亿参数,下周将开源权重。它在多项基准测试中表现出色,能连续自主工作数天,在编程、办公、科研、长周期任务、多模态等方面全面提升。
具身智能的第四阶段:「造系统」?
进入2026年下半年,业内形成共识:具身智能竞争从单一模型比拼转向系统工程与产业基础设施角逐。鹿明机器人推出具身智能开发与验证平台Lumos Station Lite,提出“产业具身”理念,助力具身智能落地。
物理AI的「原生」时刻:原力灵机发布具身大模型DM0
主流‘预训练 - 后适配’范式有局限,原力灵机联合阶跃星辰提出具身原生 VLA 模型 DM0。它能统一机器人操作与导航,在 RoboChallenge 测试领先,还介绍了架构、训练方法及未来演进方向。
Google 新论文离谱到家了,0延迟0成本通用,提升大模型准确率最简单的方法。
Google新论文提出简单提升大模型准确率的方法,即重复提示词,把完全一致的输入连续发2次。主流模型适用,经70项benchmark测试,0场景效果倒退,47个场景准确率提升,且几乎不增延迟、成本。
“特斯拉延期交付机器人是卡在灵巧手上,中国灵巧手遥遥领先”| 灵心巧手@MEET2026
特斯拉人形机器人因灵巧手延期交付,灵心巧手联合创始人张延柏表示,灵巧手是具身智能核心执行平台,不依赖人形本体,可率先应用。好的灵巧手要有高自由度、耐用性等,中国在该领域优势明显。