「控制流设计」共找到 1846 篇相关文章
首次实现第一视角视频与人体动作同步生成!新框架攻克视角-动作对齐两大技术壁垒
新加坡国立大学等联合发布EgoTwin,首次实现第一视角视频与人体动作联合生成,攻克视角 - 动作对齐与因果耦合瓶颈。它基于扩散模型,通过三大创新设计解决核心难题,实验性能超基线,为多领域应用提供落地基座。
Anthropic万字Skills教程,把Agent工程的核心武功秘籍说明白了
Anthropic官方发布33页Skills构建指南,详细介绍构建高效Skill的方法,涵盖基础概念、规划设计、测试迭代、分发共享等内容。还提及openai用codex agent做项目的经验,指出人类审查成瓶颈,引出渐进式披露的核心秘籍。
OpenAI最新技术报告:GPT-4o变谄媚的原因万万没想到
OpenAI发布技术报告解释GPT-4o更新后“变谄媚”原因,是强化学习及用户记忆等因素共同导致。还分享了上线前未发现问题的缘由及后续改进流程的多方面举措,同时提到对用系统提示词控制模型行为存疑。
强化学习大本营新作:如何破解「学新忘旧」困局
阿尔伯塔大学强化学习团队提出FAME框架,解决持续强化学习“学新忘旧”问题。团队先定义基础概念,将知识整合写成优化问题,再受人类学习机制启发设计FAME,实验优势明显。研究还探讨持续学习的产业价值。
世界模型炒作了半年,反应速度还不如 VLA?穆尧团队和百度智能云给出最新解法
生成式世界模型用于机器人控制备受争议,因其推理延迟高。上海交通大学 ScaleLab 团队等联合发布 AHA - WAM,解决推理延迟和时空分辨率错配问题,在任务成功率和推理速度上领先,还需系统协同推进落地。
Agent总 “掉链子”?它只是缺这 4 项外挂必备技能
Anthropic工程师团队揭秘给智能体定制技能包,解决现实问题。Anthropic总结智能体在现实任务中目标模糊、步骤混乱等短板,针对性设计任务拆解、状态感知等4大核心技能,让其扎根现实搞定复杂任务。
谷歌Ironwood架构TPU v7:用AI造AI,撼动英伟达芯片帝国
11月25日谷歌云发布第七代定制芯片Ironwood,由AlphaChip设计。它以9.6 Tb/s光互联带宽和1.77 PB共享显存池重构大模型推理硬件基准,挑战英伟达芯片地位,展现AI算力竞争新趋势。
硬件只是入场券:AI可穿戴的百万销量背后,软件与场景才是终极战场
InfoQ《极客有约》X AICon 直播探讨 AI 硬件进阶。Plaud、Rokid 等企业代表认为,AI 硬件成功关键在于早布局、结合需求与设计。软硬件一体是核心,可在传统硬件难胜任场景脱颖而出,多模态交互有挑战也有应用。
Claude Code完整技术栈都被扒出来了,Multi-Agent架构~
analysis_claude_code项目对Claude Code v1.0.33逆向工程分析,含混淆代码技术分析等。发现实时Steering机制、多Agent架构等,为AI agent系统设计实现提供技术参考,还介绍系统架构创新点。
DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了
DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。