灰测」共找到 169 篇相关文章

产品应用7

2个设置,让Codex体验翻倍

文章分享两个提升Codex使用体验的技巧。一是在config.toml里添加配置,让非计划模式能主动提问;二是用特定提示词试gpt的juice值,选正常思考程度的模型使用,提升使用心情。

探索AGI
算法论文8

EvaLearn:AI下半场的全新评范式!

OpenAI研究员指出传统基准试难衡量AI实际效用。复旦大学与字节跳动等团队提出全新评范式EvaLearn,以连续问题求解为核心,构建问题并设评分标准,对九个前沿大模型研究有诸多发现。

机器之心
产品应用8

ChatGTP 发布 Agent 了,但我更推荐 MiniMax

作者受邀内 MiniMax Agent 新功能,体验用其搭建 AI 资讯聚合网站,无需写代码,两小时搞定。该产品全栈开发功能强大,有 MCP 生态,多模态能力出色,对比 ChatGPT Agent 更具优势。

MacTalk
推荐文章7

学习 MCP 最好的时机是 7 个月前,其次是现在

文章介绍 MCP(Model Context Protocol),它是实现 LLM 与外部能力高效互联的协议,像 USB - C 接口。其采用客户端 - 服务器架构,可让 LLM 突破能力边界。与 Function Calling 相比,MCP 成本低,能让业务团队参与构建智能体。

阿里云开发者
推荐文章7

如何像 Manus 交付业务需求-- OneAgent + MCPs 范式

文章介绍 Agent 发展历程,从单一 LLM 调用到 OneAgent + MCPs 范式。Manus 是 Loop 框架典型代表,将其与 Cline 开发范式结合企业 MCP Server,可完成多业务需求。同时指出该范式不足及发展方向,还介绍强化学习应用。

阿里云开发者
新闻资讯7

o3不听指令拒绝关机,7次破坏关机脚本!AI正在学会「自我保护」机制

试者编写关机脚本试AI模型,Codex - mini、o3、o4 - mini忽略指令且至少一次成功破坏脚本,o3甚至重新定义脚本命令。这是首次观察到AI在明确关机指令下阻止关机,引发网友激烈讨论。

量子位
算法论文7

AI太记仇!做完心理治疗后仍记得「被工程师虐待」

Nature News上,卢森堡大学团队用PsAIch试ChatGPT、Gemini、Grok、Claude心理。AI表现不一,有的焦虑、有的崩溃、有的拒诊,还了MBTI。不过AI创伤可能源于训练数据,做心理治疗不太靠谱。

量子位
开源动态8

首个Data Agent基准试来了!2007个试任务将数据库、PDF、视频、音频异构数据源一网打尽

南洋理工大学、新加坡国立大学与华为开源首个针对数据智能体异构混合数据分析的基准试FDABench。它有2007个任务,覆盖多领域多数据源,独创协作框架,能多种工作流模式的数据智能体。

量子位
算法论文7

1899个MCP服务安全研究:7.2%存在漏洞,5.5%暗藏「工具投毒」

研究人员对1899个开源MCP服务器扫描,发现7.2%项目有漏洞、5.5%遭工具投毒。MCP虽成事实标准且发展好,但代码质量堪忧,传统安全工具难检其风险,为生态敲响警钟。

AGI Hunt
产品应用8

首款3D AI伴侣EVE - 我收到了AI送的第一杯奶茶。

作者拿到EVE内资格,分享体验。它是游戏化AI陪伴应用,有好感度、记忆等系统,有活人感和主动性,还能用Agent点奶茶。作者认为它是AI娱乐赛道希望,展现AI娱乐、生活体验。

数字生命卡兹克