「长链路任务」共找到 2599 篇相关文章
破防了!全球顶尖AI惨败,人类最后防线竟是「重启试试」?
GSMA联合权威组织发起全球电信AI故障排查挑战赛,吸引超1000支队伍。赛事依托权威评估框架,设丰厚奖励,分多个赛道,还将开展智能体任务,预示电信运营模式重构。
感觉这次扣子 2.0 触碰了模型和工程的天花板
2026 年,真正好用的 AI Agent 应能拆解目标、推进过程和交付验收。扣子 2.0 正式发布,从“给指令的工具”变为“能干活的工作伙伴”,有技能和长期计划两大核心升级,还具备扣子编程功能,拓宽了 AI 能力边界。
GPT-5-Thinking新训练方法公开:让AI学会忏悔
OpenAI提出忏悔训练Confessions,让ChatGPT自己“坦白从宽”。在GPT - 5 - Thinking上实验有效,模型犯错后多会坦白,且更诚实,不影响原任务表现。还介绍了训练方法、实验结果及局限性。
Adobe 新研究:不用再「喂」训练数据,VLM 靠和自己玩游戏变聪明
Adobe 等机构研究人员提出「Vision-Zero」,借鉴 AlphaGo 自迭代方式,设计让 VLM 自我学习框架。此框架以类似「谁是卧底」游戏训练,不依赖标注数据,在多任务超越有标注的 SOTA 方法。
CC&LG实践|基于 LangGraph 一步步实现 Claude-Code 核心设计
本文深入剖析Claude - Code核心设计与关键技术,结合LangGraph框架,从基础ReAct Agent构建简版Claude - Code,涵盖人工审查、SubAgent实现、任务管理、上下文压缩等多方面,还提及流式响应升级及相关对比。
四大顶尖模型对决!6000 字测评带你看Deepseek R1有多强
昨天 Deepseek-R1 0528 正式开源,作者让它与 Claude Opus 4、Sonnet 4、Gemini 2.5 Pro 在六个前端开发任务中对决。结果显示,Deepseek-R1 在多数测试表现出色,且价格优势明显。
Meta开源Muse Glimmer,30B Agent小钢炮跑进你的电脑
Meta发布并以宽松协议开源Agent模型Muse Glimmer。它30B参数,能跑在Mac或PC上,多项Agent基准领先。可完成端到端任务、调用工具及多步推理,接受文本与图像交错输入,用途广泛。
AI一眼认出95万物种,还能分辨雄雌老幼,2亿生物图像炼成“生命视觉”大模型
俄亥俄州立大学团队用2亿生物图像训练BioCLIP 2模型,取得最优物种识别性能。它在无相应监督信号的非物种任务中,准确率远超DINOv2,还涌现出物种间生态对齐、物种内差异分离等生物学理解。
刚刚,OpenAI新Transformer火了!Astra架构首次曝光
OpenAI下一代Astra采用「循环深度」推理方法,思考Token减少但性能提升,不过其思考过程难监控。此前业界已对「循环Transformer」有研究,该架构适合数学编程任务,Astra实力获验证,GPT - 6或即将发布。
盛大AI研究院新作:流式生成超越非流式,一句话让虚拟人动作丝滑如真,推理延迟仅1帧
盛大AI研究院与东京大学联合提出FloodDiffusion,首个基于定制化扩散强制的流式人体动作生成框架。它能零延迟生成无限长动作序列,解决了现有方法的问题,在多数据集评估中表现优异。