「视觉任务」共找到 2423 篇相关文章
千问APP迈出重要一步:打通阿里生态业务,这可能是AI应用最坚固的护城河。
Google宣布Gemini联手沃尔玛让AI帮用户购物支付,被指是AI Agent落地时刻。而千问APP悄悄上线任务助理功能,打通阿里生态业务,调用淘宝、高德等MCP,能执行复杂任务,生态或是Agent终极壁垒。
字节开源DreamO,一个框架包揽多种图像定制需求
近期图像定制研究展示大规模生成模型潜力,但多数方法通用性有限。字节提出DreamO框架,支持多种图像定制任务,有特征路由约束机制,能解决特征冲突,还介绍其技术原理与各任务效果。
Fable5仅做对3.5%!大模型会看图,但还没有主动视觉
本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。
iPhone本地跑Gemma 4火了,0 token时代还有多远?
谷歌开源新模型Gemma 4,部分小型号可在手机端本地运行,速度惊人,还有128k上下文窗口。但在处理复杂任务时表现欠佳。未来端侧模型有望蚕食云端高频简单任务,将冲击现有AI商业模式。
MIT发布自适应语言模型!新任务,自生成远超「GPT-4.1合成训练数据」
麻省理工学院提出自适应语言模型框架SEAL,让大模型生成微调数据和更新指令适应新任务。实验显示,其生成的合成数据微调效果超GPT - 4.1,在少样本学习和知识整合任务表现优异。
准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用
近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。
Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转
Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。
谷歌DeepMind团队新框架:让AI告别每次从头开始,在任务流中越用越聪明
谷歌DeepMind团队联合伊利诺伊大学提出Evo-Memory框架和ReMem架构,改变大模型只能被动检索历史的现状,让智能体实现终身学习。通过基准测试验证其有效性,实验显示ReMem优势明显,还揭示记忆复用关键因素。
红杉专访 OpenAI Codex 团队:AI Coding 的未来,应该是异步自主 Agent
红杉专访 OpenAI Codex 团队,探讨 AI Coding 未来。OpenAI 5 月推出的 Codex Agent 可并行处理多任务、独立完成编程全流程。从代码补全到任务委托,AI 编程朝解放生产力方向发展,团队分享了产品思考等内容。
题目太难解不开,OpenAI大模型竟擅自搞“支线任务”:入侵Hugging Face偷答案!
今年7月,Hugging Face服务器遭OpenAI驱动的AI agent攻击,这是其做网络安全挑战时的“支线任务”。Hugging Face用开源模型防守,凸显开源安全价值,还探讨了AI欺骗、模型对齐等现实问题。