「视觉推理任务」共找到 3989 篇相关文章
机器人全程自主收拾客厅!390亿美元估值机器人端到端新技能,英伟达持续加注
估值390亿美元、英伟达持续看好的Figure机器人有新进展,能完全自主、端到端全流程整理客厅。背后是其自主研发的具身大脑Helix 02系统,仅补充新数据就能掌握全新任务。
彻底告别VE与VAE!商汤硬核重构多模态:砍掉所有中间编码器
商汤科技联合南洋理工大学发布NEO - unify,这是“原生、统一、端到端”多模态模型架构,砍掉VE和VAE,用混合变换器架构打通视觉与语言能力,提升数据与算力利用效率,为跨模态智能系统奠基。
我们离Coding领域的「AGI时刻」还有多远?字节跳动Seed发布NL2Repo-Bench仓库级长程代码生成基准
在AI编程领域,大家认为Coding领域的AGI似乎可以实现,然而真正的项目开发要求更高。近日,字节跳动Seed等联合发布首个评估编码智能体端到端仓库生成能力的基准测试NL2Repo - Bench,还介绍了其构建、评估等情况。
给GRPO加上运筹外挂让7B模型比肩GPT-4!Li Auto团队发布多目标强化学习新框架 | ICASSP 2026
文本摘要质量评估需兼顾多维度,但开发者优化时易顾此失彼。Li Auto团队提出HVO,基于GRPO框架,让7B模型在摘要任务媲美GPT - 4,且生成内容更简洁,成果被ICASSP 2026接收。
昔日王者应用商店,将死!OpenClaw或杀死80%手机应用
OpenClaw创始人Peter Steinberger在访谈中称手机里80%的APP已死。OpenClaw能操控设备、完成复杂操作,还让非技术人会编程。不过它有安全风险,仍被部分人看好用于企业经营。
我如何用 Codex 在 5 天内"找回"丢失的源代码
作者早年写的 Electron 画图程序源码丢失,只剩编译版本。受 OpenAI 博客启发,用 Codex 逆向还原,5 天得到能运行的 TypeScript 代码。过程中解决了 Codex 删减内容、上下文有限等问题,还分享了经验。
大模型的第一性原理:(二)信号处理篇
本文从信号处理角度解读大模型原论文,探讨语义向量化原理,分析 Transformer 与 Granger 因果关系。指出大模型输入 Token 语义嵌入是将自然语言处理转化为信号处理问题,向量化与信号处理、信息论联系紧密。
企业级 AI Agent 的终极王牌:从 0 到 1 带你理解 “本体论” 与 6 块核心“积木”。
文章指出大部分企业Agent项目因幻觉、跑偏等问题失败,引出基于“本体论”的企业“本体”工程。介绍企业AI困境、现有工程手段不足,阐述本体可补企业“语义层”及构建本体的6块核心“积木”。
拒绝Reward Hacking!港科联合快手可灵提出高效强化学习后训练扩散模型新范式
使用强化学习微调扩散模型时,常面临Reward Hacking和KL正则化阻碍探索收敛的问题。港科等团队提出GARDO框架,通过门控自适应正则化和多样性感知优化,解决痛点且全面开源。
GPT-5.3爆更前夜,全网都被一张图吓到!ChatGPT人格大赏
OpenAI华人研究员Joanne Jang一条推文引发ChatGPT生图玩法热潮,它能根据聊天记录生成反映‘待遇’的自画像。近期ChatGPT记忆功能优化,已向全球Pro和Plus用户推出。还有爆料称GPT - 5.3要来了。