「基准测试平台」共找到 3278 篇相关文章
腾讯云TencentOS智能运维平台TManager正式发布 | Q推荐
为满足企业运维需求,腾讯云推出 TencentOS Server 首款智能运维管理平台 TManager。它有 30 余项功能,能 AI 智能诊断,内部稳定运行多年,覆盖复杂场景,还赢得标杆客户信任,提升运维智能化水平。
OpenAI与Anthropic罕见合作:竞争对手联手测试AI安全
OpenAI和Anthropic完成联合评估,用内部工具测对方模型并公开结果。测试覆盖指令层级、越狱等四大领域,还发现不少细节和道德困境情况。此次合作意义重大,为行业树立安全合作先例。
模型越聪明越“不听话”?MathIF基准揭示AI服从性漏洞
上海人工智能实验室与香港中文大学研究团队发布论文,用MathIF基准揭示大模型“聪明”和“听话”有矛盾,越擅长推理越易忽略指令,还分析了原因并给出让模型更“听话”的方法。
99个最佳免费AI编程智能体与平台,2025年11月最新版
文章介绍了 99 个免费 AI 编程智能体与平台,含神级工具、国内科技巨头产品等类别。这些工具永久免费、开源或有云积分,适合学生、开发者等,能以 0 成本获得生产级 AI 编程技术栈。
像Vibe Coding一样写论文!OpenAI发布免费科研写作平台
OpenAI发布免费科研写作平台Prism,将GPT - 5.2集成到在线LaTeX编辑器,功能强大。其背后是OpenAI进军AI4S领域战略,副总裁Kevin Weil称2026年将成科学界‘AI变革年’。
腾讯无极低代码平台打开MCP之外的新思路:多模态聊天
腾讯无极低代码平台提出‘前端多模态智能’概念,让AI输出内容更多样,可嵌入交互页面片。它还给出四步配置法实现‘多模态聊天’,与MCP形成互补,能增强信息交互和用户掌控感。
面向业务落地的AI产品评测体系设计与平台实现
文章聚焦淘宝闪购技术部AI产品评测,先介绍AI业务应用场景与评测挑战,接着阐述评测体系从多方面思考的要点,包括评价维度、评测方式等,还提及平台建设成果,最后展望未来多模态评测等规划。
刚刚,AI科学家Zochi在ACL「博士毕业」,Beta测试今日上线
Intology宣布AI科学家Zochi论文被顶会ACL主会录用,成首个独立通过A*级别会议同行评审的AI系统,还开放Beta测试。其研究成果显示语言模型安全措施或有不足,Zochi工作成果多且质量高。
顶尖AI竟输给三岁宝宝,BabyVision测试暴露多模态模型硬伤
UniPat AI 等发布多模态理解评测集 BabyVision,测试显示多模态大模型纯视觉能力仅达三岁幼儿水平。其通过对比实验、细分任务评测,揭示模型系统性缺基础视觉能力,还给出新方向及发展建议。
丛乐创办Acelegen:用基因编辑让活细胞成为可编程计算平台
过去五年AI重塑生物技术。CRISPR基因编辑技术开发者丛乐联合创立Acelegen,集成过往成果,欲把活细胞变成可编程计算平台,其愿景是找到“生命的Scaling Law”,独特性显著但答案待揭晓。