自动评测体系」共找到 1696 篇相关文章

产品应用7

Proactor AI:首个自主行动的AI 智能体,无需唤醒,就能主动识别对面是个骗子

Proactor AI v1.0发布,号称是世界首个「自主行动」的AI队友。它能感知、思考并自主行动,如识别骗局。还提供主动式AI服务,应用场景广泛,用户反响热烈,带来人机交互范式转变。

AGI Hunt
推荐文章8

一文读懂 Deep Research:竞争核心、技术难题与演进方向

文章梳理了深度研究系统,包括其发展历程、现有系统差异、技术实现挑战、评估体系及推理架构演进方向。指出竞争焦点转向综合比拼,评估走向专业化,未来系统将在多方面突破。

Founder Park
算法论文8

北大腾讯突破奖励模型瓶颈!让AI理解人类偏好,泛化能力比肩GPT-4.1

北京大学知识计算实验室联合腾讯等机构提出RewardAnything,突破奖励模型瓶颈。它让奖励模型理解自然语言评判原则,降低成本,泛化能力比肩GPT - 4.1,还能用于定制AI行为模式。

量子位
新闻资讯7

一个数据集,一年产稿7876篇!AI强力加持,垃圾论文海量爆发

利用美国NHANES公共数据集,结合AI工具,研究者批量生产质量堪忧的论文。这不仅是技术滥用,更是科研评价体系扭曲的缩影。背后有论文工厂作祟,根源在于学术生态的扭曲。

新智元
新闻资讯8

刚刚,OpenAI最强推理模型o3-pro诞生!碾压Gemini 2.5 Pro击穿底价

OpenAI昨夜官宣上线最强推理模型o3 - pro,还将o3价格暴降80%。o3 - pro专为深度思考和提供超可靠答案而生,在多项测试中表现优异,虽有速度慢等限制,但优势明显,网友实测效果惊艳。

新智元
产品应用8

被低估的ChatGPT新功能,10分钟搞定DeepSeek代码库深度研究

ChatGPT悄悄上线直连Github新功能,能自动读取、解析并总结整个GitHub仓库,可快速输出专业研究报告,应用场景广,还能避免“幻觉”,Plus用户即可用,开启全新研究模式。

新智元
新闻资讯8

25位IT大佬亲述:AI「吃掉」程序员!码农黄金时代终结

AI Impact Lab创始人探讨AI对技术岗位影响,提到AI公司熟悉技术岗、指标清晰等原因或致其先受冲击,调研显示AI未改变多数岗位但影响初级岗位招聘、模糊岗位边界,还对未来技术就业市场做了预测。

新智元
产品应用8

Snowflake 落地中国两年:迈向智能体企业时代,关键在上下文

本文是Snowflake入华两周年之际,在首次中国站Snowflake World Tour发布企业智能体战略的深度报道,核心提出企业AI落地关键在业务上下文,给出可落地的智能体企业架构,分享多家企业落地实践。

InfoQ
新闻资讯7

谷歌开始肢解DeepMind,数个团队被划归总部

DeepMind换帅一周后震荡持续,谷歌将拆分它,把部分非技术团队转入谷歌汇报体系。谷歌联合创始人谢尔盖·布林重新介入Gemini。此外,Gemini因算力、内讧、官僚等问题落后。

量子位
产品应用8

刚刚,Qwen3.8-Max首发上岗!「千问办公」正式开测

8月,阿里「千问办公」开启公测,它整合三款产品,还接入最新旗舰Qwen3.8 - Max。该产品交付成果可用,可一站生成多模态内容和Office产物,与钉钉打通且有组织级Skill,优势明显。

新智元