「评测平台」共找到 1912 篇相关文章
VC开始靠AI预测未来了
七月,DigClaw的预测框架Rhizome v1在FutureX评测平台取得优异成绩,支持了预测能力可沉淀在基座模型之外的判断。大语言模型不擅长预测,而DigClaw构建了以因果结构为骨架的预测基础设施。
“英伟达显卡就是一坨*”!博主6000字檄文怒批:烧接口、缺单元、驱动变砖还威胁媒体
博主Sebin发布近6000字檄文批判英伟达,指出其显卡有烧接口、缺单元、驱动变砖等质量问题,销售策略存在库存少、黄牛多、捆绑销售等问题,还试图操控媒体及评测机构。文章在Hacker News引发大量讨论。
vLLM Ascend超越MindIE? 昇腾推理Qwen3与DeepSeek R1 Distill性能实测
国内开发者在昇腾NPU上进行大模型推理面临挑战,华为MindIE推理引擎使用门槛高。昇腾联合vLLM社区推出vLLM Ascend插件。本文用GPUStack平台实测其与MindIE性能差异,得出两者在不同场景各有优势的结论。
小扎不死心Manus“自研”了一个,但模型用的Claude……
Meta推出智能体平台Hatch,功能类似Manus,开发阶段用Claude,计划正式上线时切换到自研模型Muse Spark,10月推出新模型Watermelon。Hatch注重消费数字生活,与Meta社交生态深度绑定,高端订阅有默认分发优势,但面临真实环境考验。
奥特曼最新深度访谈:AI至今没有iPhone时刻!
OpenAI首席执行官山姆·奥特曼在深度对谈中复盘大模型发展,谈及砍掉Sora和自研浏览器聚焦平台,认为AI缺iPhone时刻,还分享ChatGPT决策过程、创业经历,提出从成功学经验等观点,反驳末日论。
Perplexity提出345亿美元,收购谷歌浏览器Chrome
华尔街日报消息,AI搜索平台Perplexity欲以345亿美元收购谷歌Chrome浏览器。虽其估值仅180亿美元,谷歌无意出售,但此时要约或因谷歌面临反垄断压力,且有投资基金愿出资。
李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!
全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。
Gemini 3.0 登场后,哈萨比斯要「改造」Google 全系产品
Gemini 3.0登场引发热议,被视为Google近年最稳健升级。Google DeepMind CEO哈萨比斯谈其研发过程、团队推进能力等。新模型各方面提升显著,还将强化个性化、记忆等能力,Antigravity开发平台也备受关注。
RLinf上新πRL:在线强化学习微调π0和π0.5
近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。
国产黑马自优化「超级大脑」,全闭环Agent杀疯!一站式AI原生基建来了
AI加速落地,行业需可持续进化系统框架。清华系中数睿智将全新框架集成到语思智能平台,其5D - RAG框架破传统RAG痛点,且在多领域落地,为产业智能升级提供路径。