「代码幻觉」共找到 1854 篇相关文章
“中国AI变强,对全球安全反而是一件好事!” DeepMind传记作者:神秘模型Mythos被紧急下架,OpenAI的同款武器却被放了一马
DeepMind传记作者塞巴斯蒂安·马拉比认为,硅谷“谁先造出AGI谁通吃全球”是幻觉,AI虽实际裁员不多,但恐慌感会放大。还指出OpenAI财务窟窿大,中美AI实力均衡利于全球安全,美国政府监管混乱。
明星AI编码助手涨价10倍惹怒开发者!CEO 回应:有人花千元薅了我们10多万,不挣钱不可持续
10月16日,AI代码助手Augment Code更新定价模式,按AI使用量计费,用户称成本涨超10倍。CEO称原模式不可持续,举例有用户带来高额成本。行业内多家公司也调整定价,反映AI编码助手成本和定价难题。
DeepSeek V3.1 把 R1 融了,一堆新活:<think>开关、动态搜索、新ToolCall ...
DeepSeek在Hugging Face悄悄发布V3.1版本,将对话和推理模型合并为混合推理模型。它有显式推理、内置搜索、简化工具调用等特性,Aider测试成绩佳且成本低,但也存在战术回避、幻觉率升高等问题。
开源中小模型+Skills也性能暴增!卢森堡大学探索了小模型驾驭Skills的边界
卢森堡大学等研究探索小模型驾驭Skills的边界。工业界因数据安全渴望开源小模型,智能体Skills框架让小模型性能暴增。研究拆解小模型处理复杂任务的方法,还验证不同策略有效性,发现代码专用模型优势。
1 分钟,我在百度 App上免费部署了OpenClaw
OpenClaw热度高,但原生部署折腾且成本高,应用少。百度App提供免费轻量部署入口,耗时不到一分钟;百度智能云0.01元可进阶部署。实测它在信息搜集和代码生成任务表现好,但也有局限。
Harness Engineering 为什么是 Agent 时代的“控制论”?
本文是 George Zhang 对 Harness engineering 的解读。OpenAI 提出新工作方式,让 agent 编码,引发讨论。从瓦特调速器到 Kubernetes 再到如今的 harness engineering,本质都是控制论模式。LLM 或使代码库反馈回路在关键决策层闭合,但校准传感器和执行器是难题。
Container Use:一种用于独立的并行编码代理的新工具
Dagger团队发布开源工具Container Use,为AI编码代理提供容器化沙箱和Git工作树,实现无冲突并行工作流。它能创建隔离开发环境,让开发者在同一代码库安全运行多代理。不过该工具尚处早期,有不足。此外还介绍了其他类似工具。
RLinf上新πRL:在线强化学习微调π0和π0.5
近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。
超越英伟达Describe Anything!中科院 & 字节联合提出「GAR」,为DeepSeek-OCR添砖加瓦
中科院与字节联合提出「GAR」,为构建自然图像的Dense Caption提供新思路。GAR具备精准描述、关系建模和组合推理能力,通过引入新组件,兼顾细粒度与全局上下文,在多测试集表现优异,且代码等已开源。
OpenAI 的“编程”新范式?其实是瀑布模型的回魂:“听 PM 的话、写需求文档”
在今年AI工程师大会上,OpenAI研究员Sean Grove提出在AI驱动时代,清晰规范将取代传统代码成软件开发核心产物。他认为编程核心是结构化沟通,该转变是工程实践未来方向,但引发诸多讨论。