指令遵循率」共找到 612 篇相关文章

新闻资讯8

黄仁勋:Prompt正在过时,Loop才是新范式

黄仁勋称Prompt正在过时,Loop才是新范式。Loop指设计系统让AI自动下指令、验收,不合格重来。Claude Code和OpenAI Codex已围绕Loop落地产品,还给出了实操指南及发展历程。

量子位
产品应用7

80%代码由Claude合并,Anthropic内部人员点破Agent真相:「Close the Loop」

Anthropic团队研究产品经理Theo演讲指出,Claude已深入其工程流程,超80%代码由它合并。模型角色转变,能力提升,失败下降。开发者应升级研发战术,如刷新评估基准、精简“脚手架”、闭环设计。

机器之心
新闻资讯7

Copilot 创始工程师:大多数 AI 编码“就像开着法拉利去买牛奶一样

GitHub Copilot 创始工程师 Neel Sundaresan 正在构建 IBM Bob 智能编码工具,已有 8 万 IBM 开发者使用。他认为多数 AI 编码成本高,Bob 会按需调度模型。他还对智能体 AI 市场发表了看法,指出其有价值也有风险。

InfoQ
算法论文8

2篇最新Anthropic论文,揭开LLM对齐新范式

Anthropic在5月连发两篇研究,揭示LLM对齐训练新范式。指出单纯模仿正确行为不足以保证安全,需在预训练与对齐微调间插入教原理阶段。研究围绕Claude模型展开,有多项关键发现,MSM方法效果显著。

PaperAgent
算法论文7

OpenClaw的风刮到了多模态生成,6B小模型超越Nano Banana 2!

现在多模态生成模型在复杂指令和下游任务表现不佳。上海人工智能实验室等团队提出GEMS,将OpenClaw成功应用于多模态生成领域,激发小模型潜力,让6B小模型部分任务超越Nano Banana 2。

量子位
新闻资讯8

OpenAI连夜爆出GPT-5.4! 紧急上新GPT-5.3反击谷歌, AI爹味治好了

谷歌DeepMind推出Gemini 3.1 Flash - Lite不到2小时,OpenAI上线GPT - 5.3 Instant,不卷跑分,专治「聊天翻车」,幻觉降27%,写作能力提升,还剧透GPT - 5.4更快到来。

新智元
产品应用7

我如何用 Codex 在 5 天内"找回"丢失的源代码

作者早年写的 Electron 画图程序源码丢失,只剩编译版本。受 OpenAI 博客启发,用 Codex 逆向还原,5 天得到能运行的 TypeScript 代码。过程中解决了 Codex 删减内容、上下文有限等问题,还分享了经验。

宝玉AI
开源动态8

告别AI胡说八道,Meta新方法CoVe准确飙升 28%

大模型‘幻觉’问题一直是‘严肃使用场景’的难题。Meta AI团队提出CoVe新方法,让大模型学会‘自我反省’。该方法通过四步走实现自我纠错,能大幅降低幻觉,还具备三大优势。

CourseAI
推荐文章8

AI 医疗全景更新:为什么硅谷 healthcare 领域出现了最多的 AI 独角兽?

本文基于对全美700余位医疗行业高管的调研及关键人物访谈,梳理AI医疗落地路径与商业化逻辑。指出医疗行业正推动AI商业化,投资增长催生独角兽,落地呈现“非线性加速”,还介绍了投资格局、应用场景等情况。

海外独角兽
新闻资讯7

OpenAI 将推出群聊功能,终于要对 Slack 下手了

据爆料,ChatGPT 网页版将推出群聊功能预览版。群聊可通过链接分享,新成员能看历史记录,自定义指令独立,还有表情反应等交互功能。OpenAI 或借此获取对话数据,有取代 Slack 之意。

AGI Hunt