存在检测」共找到 742 篇相关文章

新闻资讯7

Claude不到4%,全军覆没!一场大考撕碎Agent「全自动办公」幻想

新智元报道,UniPat AI的SaaS - Bench实战考卷,用23个真系统、106个任务测试Agent。结果显示,Claude Opus 4.7完全通过分数仅3.8%,多数模型全军覆没,暴露了Agent在真实环境中的四种致命缺陷。

新智元
产品应用7

GPT5.5 + Codex 如何跑一整夜,编程的下一步,不是辅助编程,是可托管执行单元

文章指出GPT - 5.5在Codex里展现出强大自主性,能处理长时程任务。还介绍让其跑长任务的方法及面临的问题,强调长任务需状态机、证据链等,社区也在构建相关工作流层。

AI进修生
算法论文7

苹果新论文发出惊人一问:What do your logits know?

苹果AI研究团队提交论文《你的logits知道些什么?(答案可能会让你惊讶!)》,触及大模型底层逻辑及苹果看重的用户隐私与数据安全。研究通过实验揭示模型信息留存状态,指出存在隐私泄露隐患。

机器之心
新闻资讯7

苹果疯狂狙击Vibe Coding App

苹果在App Store对多款Vibe Coding应用采取限制措施,阻止更新、下架产品。苹果称是因应用绕过审核机制,存在安全风险,但开发者质疑其动机,背后或有商业利益考量,网友也吐槽苹果政策陈旧。

InfoQ
产品应用8

阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了

阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。

AI工程化
开源动态8

告别“对讲机”时代:面壁智能给 AI 装上了“神经末梢”

2026 年初,OpenClaw 等开源项目让 Agent 概念爆火,但存在延迟、隐私等问题。面壁智能发布 9B 小模型 MiniCPM - o 4.5 和硬件开发板松果派,解决 AI 本地运行痛点,推动其从云端到端侧进化。

AI科技大本营
新闻资讯7

cursor翻车了,Anthropic:来,我教你怎么做long running Agent。

近期,Cursor宣称用大量智能体实现长程任务引发关注,但被指是营销惨案,代码存在诸多问题。Anthropic则分享务实的long - running思路,是记忆接力模式,代码可维护。未来模型能力提升或让代码成黑箱。

探索AGI
推荐文章7

Cursor 重新定义 Agent:脑子再大,不如会翻书。

Cursor 分享博客指出,Dynamic Context Discovery 效果远好于 long context 方式,开启动态上下文可使总 Token 消耗降 46.9%,还能减成本、降延迟、提准确率,但也存在成本转嫁、工程复杂度高和安全风险等问题。

探索AGI
新闻资讯7

聊聊腾讯 AI 的「松弛感」

文章通过播客内容探讨腾讯AI现状、大厂进击及2025年AI行业趋势。指出腾讯AI存在感弱与策略有关,其以连接器战略拓展;今年场景和用户体验优先级提高,大厂有内部提效等隐形壁垒。

刘言飞语
新闻资讯8

Runway Gen-4.5刷屏发布,把重量、尘土和光影都做对了,网友:颠覆

Runway Gen-4.5突袭发布,获“视频生成AGI时刻”评价,在Artificial Analysis测试中拿下SOTA。它能精准执行复杂指令,物理还原与视觉精准度强,官方将逐步开放使用权限,还直言其存在因果推理等局限。

量子位