「手办图」共找到 531 篇相关文章
Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR
GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。
6行代码搞定AI Agent记忆!这个16K Star的开源项目打破了传统RAG痛点!
传统RAG方案有上下文断裂、检索不精准等问题,而开源项目Cognee用6行代码就能给AI Agent构建持久化记忆系统。它结合向量搜索和图数据库,形成统一记忆层,支持30+数据源,有多种核心API。
The Batch: 969 | 谷歌的机器人模型有了腿
谷歌发布 Gemini Robotics 2(GR2),能将相机图像和文字指令转为机器人关节控制命令,可同时控制人形机器人腿、躯干、手臂和手部,简化模型训练和设计,不过谷歌未公布其基础模型等信息。
提前实测Opus 5:3D细节封神,然而有一个致命缺陷
全网苦等Opus 5,结果其暂缓发布,理由是怕威胁人类对高级AI的控制,遭网友怒批。部分开发者提前实测,它3D细节表现出色,但耗token且看图测试翻车,原定有诸多强大特性。
Anthropic 的 Harness 哲学:把 Agent 当牲口,而非宠物
本文分享Anthropic最新两篇博客,介绍其将运维圈“宠物 vs 牲口”哲学用于AI Agent架构设计。旧架构如“宠物”易出问题,新架构脑手分离,把Harness做成可随时重启的“牲口”,降低延迟、提升安全,还提出信任框架。
来了,DeepSeek又悄悄开源LPLB项目
DeepSeek 悄悄开源 LPLB 项目,该项目解决 MoE 小批量训练专家每批 token 数抖动问题。LPLB 在 EPLB 基础上,将‘冗余专家’看成带容量边的图,每批解一次线性规划,实现 token 重新路由,单节点 100µs 级求解。
刚刚,Figure 03人形机器人登场,能感知一枚回形针重量
Figure 03是初创公司Figure发布的第三代人形机器人,能做家务、胜任服务类工作,指尖可感知3克力。它配备新传感器和手部系统,为家庭设计,实现无线自主运行,也为量产和商业应用做了诸多优化。
Sam Altman亲晒GPT-5实测问答,发布进入倒计时
今日凌晨,OpenAI的Sam Altman晒出GPT - 5实测问答图,意味着其基本完成基础开发,很快发布。不过其回答与其他模型差异不大,但爆料称它代码和商业化能力强,网友对此看法不一,还猜测其对SaaS行业的影响。
NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理
面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。
马斯克机器人出街卖爆米花,还会捉弄顾客
马斯克的特斯拉Optimus机器人出街卖爆米花,还会捉弄顾客、给小朋友递爆米花、拍照比剪刀手。它是全黑款,此前还曝出金色款,且开通中国区微博。此外,小鹏首款机器人‘Iron’亮相慕尼黑车展。