评估工具」共找到 2539 篇相关文章

产品应用8

阿里 Qoder 把这层 AI 编程的窗户纸捅破了

2025年大模型下沉到应用层,浏览器和编程工具被重新发明。阿里新发布的Agentic编程平台Qoder,增强对巨大代码工程理解能力和代码生成准确率,其上下文工程观是突破,新引入的Quest Mode很独特。

MacTalk
新闻资讯7

小扎“亿元俱乐部”车门焊死!被曝冻结招聘,禁止内部人员流动

Meta超级智能实验室被曝冻结招聘,禁止员工跨团队调动。此前Meta大举招人,现因新老员工矛盾、AI部门重组及市场对“AI泡沫”担忧等因素调整战略,虽AI投资有收益,但仍需评估

量子位
开源动态7

京东发布业界首个/开源/高完成度/轻量化「通用AI智能体产品」。

京东跨界推出业界首个开源高完成度轻量化通用智能体产品JoyAgent - JDGenie。它开箱即用、轻量可自部署,内置多种子智能体与工具,还给出二次开发示例,有多层次多模式思维等创新点。

开源AI项目落地
产品应用8

DeepRare 重磅发布:全球首个可循证智能体诊断系统,直击医学Last Exam难题

上海交通大学人工智能学院等联合发布全球首个罕见病推理型智能体诊断系统DeepRare。它结合大模型和多智能体架构,模拟医生诊断思维,支持多模态输入,在多数据集评估中表现出色,已上线在线平台。

机器之心
7

IMO怒斥OpenAI自封夺金,“91位评委均未参与评分”,网友:炒作无下限

OpenAI宣称新模型获IMO金牌不到24小时剧情反转,多位官方人士和大佬指其做法“粗鲁且不恰当”。其“金牌”成绩或站不住脚,未与官方合作,无评委参与评估。此事引发学术道德和商业炒作争论。

量子位
新闻资讯8

「AI重大飞跃」OpenAI官宣:内部实验模型在IMO 2025中取得金牌,GPT-5即将发布

OpenAI研究员Alexander Wei宣布团队开发的内部推理模型在IMO 2025中获相当于人类金牌成绩,还透露GPT - 5即将发布。模型按人类规则评估,解决5个问题,代表AI通用推理能力飞跃,成果不局限于数学推理。

AI寒武纪
7

大模型如何赋能 Web 渗透测试?

文章指出传统Web安全检测有局限,而大语言模型(LLM)可提升漏洞发现覆盖率与准确性。以mcp server为基础介绍自动化漏洞检测方案,还分享实践操作、遇到的问题及解决办法,分析其优缺点并给出拓展思路。

阿里云开发者
产品应用7

刚刚,为对抗哥大退学生开发的AI作弊器,哥大学生造了个AI照妖镜

Cluely是款备受争议的AI桌面助手,能替人参会。哥伦比亚大学学生开发反Cluely工具Truely,检测通话是否为真人。其原理是检测对方设备PID,不过使用较繁琐。同时,Cluely起诉公布其提示词的人。

机器之心
算法论文8

普林斯顿等高校提出AgentDistill:无需任何训练即可继承大Agent复杂能力,性能提升48%,成本降低90%

在AI领域,大型语言模型智能体计算需求大限制部署,传统蒸馏技术对智能体效果有限。AgentDistill提出解决方案,让学生智能体复用教师智能体的MCP工具包,无需训练继承复杂能力,小模型性能显著提升。

深度学习自然语言处理
开源动态8

Agent RL和智能体自我进化的关键一步: TaskCraft实现复杂智能体任务的自动生成

当前智能体训练缺高质量任务数据,主流数据集依赖人工标注,规模和复杂性受限。OPPO 研究院提出 TaskCraft 框架,能自动生成智能体任务,构建并开源含约 41,000 条任务的数据集,支撑智能体训练评估

机器之心