评估工具」共找到 2536 篇相关文章

开源动态7

AI还不会独自问诊,o3准确率仅为51.12%,上交大×SII开源高难度复杂疾病诊断测评集

上海交大与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有大模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。

量子位
产品应用7

这一夜,中国AI彻底翻身了:DeepSeek R1让全世界刮目相看 | 深度评测

作者深度测试新DeepSeek R1,发现其代码生成能力超Claude 3.7,虽编程全面性有不足,但已处Claude 3.7与Claude 4之间。前端设计审美达Claude 4水准,部分方面略胜,有自主学习推理能力,或改变中国AI历史。

AI产品黄叔
算法论文7

多模态模型具备“物理推理能力”了吗?新基准揭示:表现最好的GPT-o4 mini也远不及人类!

来自多机构研究人员构建PhyX基准测试,评估多模态模型物理推理能力。测试显示,即便表现最佳的GPT - o4 mini准确率仅45.8%,远不及人类的75.6%,且模型在多方面存在结构性缺陷。

量子位
推荐文章8

AI 不会杀死初级开发者——但你的招聘策略可能会

文章指出在 AI 编码普及的行业,初级开发者角色转变但不可或缺。AI 虽自动化部分任务,却带来新挑战与期望。初级需培养新技能,避免过度依赖,公司也应调整招聘、培养和评估方式。

宝玉AI
新闻资讯7

AI杀死大学?教授ChatGPT教学逼疯学生,怒告学校讨要8000美元学费!

美国东北大学一名学生发现教授用ChatGPT生成课件,愤而起诉学校讨要8000美元学费。学生认为付高价学费应接受人类教导;教授则称AI可节省时间、充当助教。不同教授对AI使用看法不一,领英联合创始人看好AI在教育的应用。

新智元
新闻资讯7

2025年哪款模型最受欢迎?Poe最新报告:DeepSeek降温、可灵成黑马

AI工具聚合平台Poe发布2025年1 - 5月人工智能模型使用趋势报告。显示模型市场份额消长明显,推理模型势头正劲,图像、视频、音频生成领域各有竞争态势,如DeepSeek降温,可灵成视频生成黑马。

Founder Park
新闻资讯8

刚刚,DeepMind通用科学智能体AlphaEvolve突破数学极限,陶哲轩合作参与

DeepMind发布革命性进化编码智能体AlphaEvolve,由LLMs驱动,可演化代码库、发现和优化算法。它结合LLM创造力与自动化评估,减少幻觉,在多领域应用前景大,还与陶哲轩合作探索数学应用。

机器之心
产品应用8

破解300年数学难题,智能体大突破!谷歌发布超强AI Agent

今天凌晨谷歌Deepmind发布编程AI Agent——AlphaEvolve,它与Gemini深度集成,能评估算法。它解决了300多年的数学难题,还提出新算法,提升大模型计算效率,可优化GPU指令,架构含多模块。

AIGC开放社区
推荐文章7

AI Agent 十问十答,降低认知摩擦

文章以问答形式梳理技术术语与价值信息,介绍AI Agent定义、与传统软件区别、演进原因等,还阐述组件、原理、提升输出效果方法,探讨Workflow与LLM关系及单/多智能体系统相关内容。

阿里云开发者
新闻资讯7

OpenAI发布GPT‑6 Astra:百万级上下文,主攻编程和复杂办公

9月3日,OpenAI发布GPT - 6 Astra,重点提升电脑操作、软件开发和复杂工作处理能力。它有诸多更新,如电脑操作提速、支持异步工具调用等,但也存在监测难、价格高的问题,实际效果待验证。

AIGC开放社区