「测试驱动」共找到 2274 篇相关文章
MIRIX重塑AI多模态长期记忆:超Gemini 410%,节省99.9%内存,APP同步上线
UCSD和NYU团队推出开源的MIRIX,全球首个多模态、多智能体AI记忆系统。它表现亮眼,在多任务中超越传统方法,有类人记忆系统等特点,还上线Mac端应用,开启大模型从对话生成到长期记忆驱动心智的新周期。
都在卷「让大模型多循环几遍」,这个7B模型LoopCoder v2说:多循环 1 次就够了
当下推理模型流行在测试时多循环,以打磨答案。但新研究发现,7B模型LoopCoder v2只多循环1次(共2次),就能大幅提升性能,继续增加循环次数,性能反而下降。研究还分析了收益与成本,给出选择循环次数的诊断方法。
昨天夸国产大模型争气,今天Vidu Q3就霸榜了
国产视频大模型Vidu Q3在国际权威AI基准测试机构Artificial Analysis的最新榜单里,于Video Arena冲到全球第二、国产第一。它是全球首个支持16秒音视频直出模型,声画同出、高清直出,还有镜头控制、多语言文字渲染等优势。
Qwen3小升级即SOTA,开源大模型王座快变中国内部赛了
开源大模型进入中国时间,Kimi K2风头正盛时,Qwen3迎来升级,235B总参数量仅为Kimi K2四分之一,基准测试性能却超它。Qwen官方不再用混合思维模式,新模型仅支持非思考模式,此次是小更新,大招在后头。
英特尔接不住泼天富贵?
英特尔公布2025年第四季度财报,营收137亿美元,净亏损6亿美元,但好于市场预期。不过,其对2026年第一季度业绩展望低于市场共识,股价盘后一度跌逾12%。主要因供应限制,无法兑现AI驱动的CPU需求红利,且业务短板仍存。
出了两道真题考 GLM-5.2,Opus 4.8 和GPT 5.5 陪跑
作者对GLM - 5.2、Opus 4.8和GPT 5.5进行两项测试。一是审计Skill体系,GLM - 5.2覆盖skill数多、找出冲突多,还挖出bug;二是做世界杯夺冠推演器网站,Opus表现出色,GLM - 5.2省token,Codex有巧思但结构有缺陷。
存储芯片领域又冲出一家IPO!年入37亿
AI驱动存储“超级周期”,行业巨头提价,国内存储芯片公司股价上涨。深圳晶存科技9月底递表港交所,此前募资超7.06亿,2024年末投后估值37亿。虽净利润为正,但经营现金流持续为负,全球嵌入式存储市场市占率约1.6%。
GPT-5.2被曝作弊!偷袭谷歌竟靠拉爆token刷高分,不如Gemini 3
新智元报道,OpenAI刚发布GPT - 5.2就被指「作弊」,其在基准测试中或调参数使模型用更多算力资源。有用户发现它消耗远超对手的token才获成绩,真实能力或与Gemini 3相当。此外,还揭示了OpenAI为商业利益牺牲学术独立的问题。
谷歌IMO金牌级Gemini 3深夜上线!华人大神挂帅,OpenAI无力反击
谷歌DeepMind推出IMO最强金牌模型Gemini 3 Deep Think,以2.5倍暴力性能碾压GPT - 5.1。它在多项基准测试表现出色,已在Gemini App上线。谷歌还将在新加坡组精英团队,由华人科学家Yi Tay率队。此外,Gemini 3 Pro使网页端市占率创新高。
大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26
vivo AI Lab团队针对自动手语翻译生成中,无视觉证据支撑的错误累积导致语义偏移的痛点,提出置信度感知策略优化方法CAPO-SLT,仅调整强化学习更新规则,不修改主干网络,在中文手语翻译测试中拿下三项指标最高分,成果将发表于EMNLP'26。