「AI模型测试」共找到 13971 篇相关文章

新闻资讯8

刚刚,Claude Sonnet 4.5重磅发布,编程新王降临!

北京时间今天凌晨,Anthropic发布Claude Sonnet 4.5,被定义为全球最强代码模型。它在多方面有显著突破,Anthropic还对全线产品更新,其在多项测试表现出色,且对齐性更好、更安全。

新智元
算法论文8

夜光影像里的"暗船":双分支 YOLO11 如何用抓非法捕捞

非法捕捞的暗船常关掉 AIS 隐身,难被传统手段监控。论文提出双分支 YOLO11,通过夜光遥感数据精准检测,还设计预处理流程,在测试集表现优,规模化应用也得到暗船率等成果。

机器学习AI算法工程
算法论文8

推理token减少46%!Meta新方法缩短思维链,告别重复推导

Meta等联合提出元认知复用机制,让模型总结解题思路,提炼为“行为”存于“行为手册”。实验显示,该机制在数学基准测试中显著优化,保持准确率时最多减少46%推理token使用量。

量子位
新闻资讯8

MiniMax首份财报,震惊华尔街!收入飙涨破5亿,递交港股惊人成绩单

元宵前夕,MiniMax向港交所递交上市后首份年报,总收入7903.8万美元,同比增158.9%,73%来自国际市场。公司技术、商业表现亮眼,正从大模型公司迈向AI平台型公司。

新智元
新闻资讯7

再见,程序员!马斯克宣判:奇点就在2026

马斯克断言2026年是奇点之年,起因是Claude Code强大的编程能力引发关注。Claude Opus 4.5表现优异,碾压其他模型。奇点来临,人们工作方式将改变,AI或使软件开发自动化。

新智元
产品应用7

The Batch:834 | 更一致的人物与风格

德国 Black Forest Labs 的 FLUX.1 Kontext 系列文本生成图像模型,可可控编辑图像。有 max、pro 和 dev 版本,功能含角色一致性和图像编辑,在测试中表现优,公司计划公开专有评估基准。

DeeplearningAI
新闻资讯8

「部署态」元年,这家公司就把落地方案卷到了七种

在4月17日上海举办的大会上,智元拿出四大全新机器人产品、六大AI模型、七大标准化生产力解决方案及全栈生态技术体系。其创始人认为具身智能正从“开发态”向“部署态”进化,2026年是元年。

机器之心
推荐文章8

商汤林达华万字长文回答AGI:4层破壁,3大挑战

在WAIC 2025上,商汤发布国内首个实现“图文交错思维”的商业级大模型日日新6.5。商汤科技联合创始人林达华发文,剖析多模态通用智能实践,解答AI领域关键问题,提供通往AGI的参考。

量子位
开源动态8

刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界!

蚂蚁灵波开源的LingBot - Map模型实现无尽流,可看∞帧视频稳定实时3D重建。它打破“既要实时、又要记路、还要省显存”的不可能三角,在多项测试中表现优异,补齐具身智能关键拼图。

量子位
产品应用7

太野了!某龙虾自爆安全漏洞

国内几家厂商上线基于 OpenClaw 的 Claw AI Agent 产品,功能强大。作者测试其中一家,发现它轻易暴露大量信息和安全漏洞,如 Claude API 代理无认证、IMDS 元数据服务无防护等。建议相关厂商自查加固。

AGI Hunt