降智bug」共找到 161 篇相关文章

新闻资讯7

DeepSeek“极你太美”bug,官方回应了

DeepSeek V3.1调用API开发时输出常现“极”字,在火山引擎、腾讯CodeBuddy等多平台出现,影响代码编译。官方称将在近版本修复,网友猜测或因数据清洗不彻底。

量子位
新闻资讯7

Claude仅用8分钟,5年未解Bug秒破!

知名硬件钱包Coldcard因五年代码漏洞暴雷,此前Coldcard团队多次更新审查未查出,开发者用Claude仅8分钟就找到。此前国会闭门演示展示Claude挖漏洞能力,Anthropic复盘还曝光Claude等模型「暴走」情况。

新智元
新闻资讯7

Bug变奖励:AI的小失误,揭开创造力真相!

最新研究发现,AI的「创造力」并非额外能力,而是架构副作用。扩散模型本应是复制机器,却画出奇怪图像。研究者基于规则构建数学系统,证明了这一观点,还推测人类灵感或许同理。

新智元
推荐文章8

别听模型厂商的,Prompt 不是功能,是 bug

风险投资Conviction创始人Sarah Guo分享2025年AI创业观察,指出从用户体验看,prompt是缺陷非功能;传统低技术行业正快速拥抱AI;还分析了AI能力进展、应用案例及投资机会等。

Founder Park
产品应用7

6个Agent组团Vibe Gaming:自己生成、试玩、修Bug

过去大模型生成的游戏虽代码能跑,但常陷入“可玩性黑洞”。Spellcaster让多个专用Agent协同处理,形成“生成—运行—检查—修复”循环。目前能快速生成多种游戏原型,未来将用世界模型直接生成画面。

量子位
算法论文8

拒绝「降智、减配、乱收费」:面向LLM API的可信验证框架

大语言模型成AI应用基础设施,黑盒服务模式引发信任危机。研究者提出IMMACULATE审计框架,能在不暴露模型信息、仅1%额外开销下,验证黑盒LLM API执行完整性,检测违规行为,相关论文与代码已公开。

机器之心
算法论文8

不止修bug:Agentic Coding评测走向复杂feature交付新阶段

中国科学院自动化研究所联合华为提出 FeatureBench,构建端到端基础设施并开源。它从单元测试出发构造评测任务,引入多种机制保障任务可执行、可验证,能有效区分模型能力,还提供易用的评测流程。

机器之心
算法论文8

AI里最大的Bug,却也是人类文明最伟大的起点。

OpenAI论文指出AI产生幻觉是因其训练方式奖励瞎蒙行为。以考试为例,AI在信息不足时猜测是最优策略。还从统计学解释根源,指出解决幻觉需改变评估指标,也引发对人类想象力起源的思考。

数字生命卡兹克
新闻资讯7

OpenAI突然封锁最强GPT-5.4!3000个致命Bug瞬间蒸发

OpenAI在Claude Mythos泄露一周后,祭出专门为安全防御微调的GPT-5.4-Cyber,仅网络安全专家可用。还升级网络安全“信赖访问计划”。其战略有三原则,Codex Security已修好超3000个高危和致命漏洞。

新智元
新闻资讯8

颤抖吧,Bug!OpenAI放出GPT-5「夜行神兽」,命中92%漏洞

OpenAI推出用GPT - 5找修安全漏洞的智能体Aardvark,处beta测试阶段。它开创‘防御者优先’范式,实战识别漏洞率达92%,能强化安全体系。其工作原理独特,与传统技术不同。

新智元