「视觉记忆模型」共找到 8308 篇相关文章
Claude能直接操控你的电脑微信了,这才是真正的上位小龙虾。
Claude新发更新,可通过Computer use纯视觉方案操控电脑,还更新了远程操控Dispatch。这俩功能组合让Claude能操控微信等本地软件,使用简单,且权限管控和防护较好,更新速度快,领先同类产品。
"将注意力旋转90°":深入浅出解读 Kimi 最新出圈成果
Kimi论文‘ATTENTION RESIDUALS’引发AI圈热议,马斯克等大佬高度评价。该论文由17岁高中生陈广宇参与,提出‘注意力残差’机制,解决标准残差问题,分全、分块注意力残差,权衡开销与效果。
OpenClaw 背后核心框架 Pi:好的 Coding Agent 应该让用户来决定需要什么
OpenClaw 背后核心框架 Pi 是极简框架,系统提示词和工具定义不到 1000 tokens。开发者 Mario 认为好的 coding agent 应让用户决定需求。Pi 不支持 MCP 等,在 Terminal Bench 2.0 排名靠前,GitHub 星数超 24000。
26.7K 标星!GitHub 高分教程 Learn Claude Code:12 节课带你手搓一个 Cursor!
Learn Claude Code是shareAI - lab开源教学项目,目标是让人理解AI编程Agent工作原理。它有12节课,每节加一个机制,逻辑清晰。配交互式Web平台,文档‘心智模型优先’,还提供后续项目助知识落地。
复旦北大联合美团LongCat提出TDAR:用“粗思考,细求证”破解Block Diffusion的速度精度悖论
复旦大学、北京大学联合美团LongCat提出Block Diffusion推理模型Test-Time Scaling新框架TDAR,引入‘粗思考,细求证’范式与有界自适应置信度解码,打破速度与精度零和博弈,在多基准测试表现出色。
对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容
本文对话 Seede AI 创始人 Longyi,探讨 AI 设计产品发展。Seede AI 主打将原始素材转化为可交付设计稿,易上手、受众广。创始人认为不转向 AI - Native 没救,产品已跑通 PMF,目标是帮人类理解 Agent 产出内容。
我们给OpenClaw加了一双眼睛,来观察我们这平凡的一天。
内容创意组小伙伴用Pocket 3作OpenClaw的“眼睛”,俯拍工位区,截取图片喂给多模态模型描述场景,下班时让OpenClaw分析趣事。还开发了“OpenClaw人类观察计划”,开发过程简单,降低了Agent体验门槛。
GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!
GLM - 5正式发布,把开源AI带入长任务时代。它超24小时自己跑代码,完成GBA模拟器,能力稳定。评测结果佳,在主流测试中编程能力与Claude Opus 4.5对齐,引发网友欢呼。实测还展现多种应用能力。
AI 硬件新物种:七位从业者对消费级 AI 硬件的答案
2026 年 CES 落幕,释放中国 AI 硬件集体出海信号。蚂蚁集团等主办的活动上,7 位从业者分享消费级 AI 硬件产品,涵盖养成宠物、智能戒指等。他们认为 AI 硬件竞争焦点正从模型能力转向场景理解。
Z-Image标准版开源:更具可塑性的图像生成全能基座
Z-Image标准版开源,它是为开发者准备的强大画板,解决了生成模型同质化问题。其保留完整权重,在微调、风格化上潜力大,采用创新架构,训练定位SFT阶段,有完整CFG支持,还提供完善工具链。