「长任务跑分」共找到 2657 篇相关文章
AI Agent 是长期运行的“风险系统”,如果你还只在防 Prompt Injection,说明已经落后一代了
AI安全公司CyberArk首席软件架构师Niv Rabin团队提出基于“指令检测”与“历史感知校验”的方法,防御大语言模型和AI Agent恶意输入与历史投毒攻击,介绍多种防御机制。
8B模型任务击败GPT-5?阶跃星辰开源Deep Think新框架,小模型解锁百万Token测试时计算
阶跃星辰推出并行协同推理框架PaCoRe,让大模型突破上下文窗口和处理速度限制。基于此框架,小模型能解锁百万级Token测试时计算。PaCoRe - 8B在数学基准测试中超越GPT - 5,还具备前沿性能、“综合”能力涌现等优势。
10人创业团干翻行业“潜规则”!全员必须会AI、让跑大模型全程“裸奔”,谷歌老兵不烧钱创业
在AI创业浪潮中,谷歌老兵Bryan Zhou带领10人团队创立AnyInt平台。该平台定位AI Infra中间件,一个API对接所有模型,提倡“去中心化”,让用户付费,还在工程、安全等多方面优化,吸引开发者付费。
10人创业团干翻行业“潜规则”!全员必须会AI、让跑大模型全程“裸奔”,谷歌老兵不烧钱创业
谷歌老兵Bryan Zhou投身AI创业,组建AnyInt团队。该平台定位AI Infra中间件,一个API对接所有模型,提倡“去中心化”。团队一开始就奔着付费用户,还做了极致性能优化,吸引众多开发者。
OpenAI首席研究员Mark Chen长访谈:小扎亲手端汤来公司挖人,气得我们端着汤去了Meta
OpenAI首席研究官Mark Chen在访谈中爆料Meta抢人大战升级成送汤大战,还谈到OpenAI核心研究团队规模、应对Gemini 3策略等。他认为OpenAI本质是研究公司,有信心在预训练和模型性能上超越对手,还提及OpenAI for Science等计划。
国产芯片比英伟达整体效率更高!?华为 CloudMatrix384 超节点首曝论文,跑 DeepSeek 效率超越英伟达
今年4月,网上曾争论华为芯片效率是否超国际主流。近日华为团队论文公开,阐述在CloudMatrix 384超节点部署DeepSeek大模型细节,性能指标超英伟达体系,还介绍架构、软件栈及适配优化方案。
他们从四家顶尖AI实验室辞职,打造能自己跑实验的AI系统,目标是让科学家实现Vibe Research
2026年初,Harsh Mehta和Behnam Neyshabur离开Anthropic,在旧金山注册Mirendil,6月25日公司亮相并完成2亿美元种子轮融资。团队来自四家顶尖机构,目标是构建自主处理AI研发问题的系统,降低AI研发门槛。
解决VLA模型落地难,普通硬件也能跑!全透明全开源的高效VLA模型把推理成本砍掉76%
2026年4月,中山大学与MBZUAI联合推出A₁模型,它是完全开源透明、自适应高效的截断式视觉 - 语言 - 动作模型,能削减推理成本、实现低成本落地,在仿真与真机上表现优异。
凌晨三点写代码、10个 Agent 同时跑!ClawdBot 创始人自曝 AI 上瘾史:Claude Code 入坑,Codex 成主力
本文讲述 ClawdBot 创始人 Peter Steinberger 的开发经历。他曾打造知名 PDF 框架,后经历倦怠回归,借 AI 重塑开发方式。分享入行故事、用 AI 编程的日常及构建 ClawdBot 的过程,探讨软件工程变化及对新人的建议。
凌晨三点写代码、10个 Agent 同时跑!ClawdBot 创始人自曝 AI 上瘾史:Claude Code 入坑,Codex 成主力
Clawdbot(现名:Moltbot)爆火,其创始人 Peter Steinberger 分享开发经历。他曾打造 PSPDFKit,后经历职业倦怠。回归后用 AI 编程,从 Claude Code 入坑,Codex 成主力,还分享了 AI 重塑开发方式的见解。