「任务控制中心」共找到 2564 篇相关文章
比NanoBanana更擅长中文和细节控制!兔展&北大Uniworld V2刷新SOTA
兔展智能与北京大学的UniWorld团队推出图像编辑模型UniWorld - V2,它提出UniWorld - R1框架,在权威测试中超越顶尖闭源模型。该框架通用性强,能提升其他基础模型性能,相关论文、代码和模型已开源。
NIPS2025|小红书智创AIGC团队提出布局控制生成新算法InstanceAssemble
当下文本生成图像扩散模型有进展,但现有布局到图像生成方法在复杂场景表现不佳。小红书智创AIGC团队提出InstanceAssemble框架,从架构和评测应对难题,实现复杂布局下精确图像生成,有广阔应用潜力。
Temporal:Nvidia、OpenAI 都在用,为什么 Agent 还需要专门的长程任务工具?
本文编译了 Temporal CTO Maxim Fateev 的访谈。Temporal 提出 durable execution,确保工作流可靠执行,即使出错也能继续。它获 1.46 亿美元 C 轮融资,Nvidia、OpenAI 是客户。不过,它也面临 AI 发展和云厂商竞争等挑战。
GAIA 榜首,杀疯了!高并发、多任务京东开源的JoyAgent秒杀行业巨头
本公众号关注AI前沿技术,分享实战案例与课程。京东开源轻量化通用多智能体产品JoyAgent - JDGenie,可挂载新场景功能,在GAIA榜单准确率超行业知名产品,还介绍了其架构特点与创新点。
特朗普宣布900亿美元建设AI中心,谷歌、黑石集团等领投
首届宾夕法尼亚州能源与创新峰会召开,特朗普宣布超900亿美元投资承诺,要把该州打造成美国AI核心。谷歌、黑石等多家机构参与投资,涉及数据中心、能源基建等项目,还强调了“能源安全人工智能”理念。
谷歌AI Agent刚开源!多任务智能体+MCP+谷歌搜索,狂揽9000颗星
今天凌晨,谷歌在官网开源AI Agent框架Gemini CLI,将Gemini大模型融入终端。它能调用视频和图像模型,集成MCP、谷歌搜索等功能,还集成超强编码助手,刚开源就在Github超9000颗星。
让chrome浏览器变成你的智能助手,浏览器转变为强大的 AI 控制自动化工具
Chrome MCP Server是基于chrome插件的模型上下文协议服务器,能让大模型或chatbot接管浏览器。它有chatbot/模型无关、用原本浏览器等特性,与同类项目比优势明显,还介绍了使用步骤、工具及示例。
准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用
近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。
具身导航,感知推理到底是「上帝」,还是执行控制是「命门」?| GAIR Live 023
本文是GAIR Live 023圆桌对话实录,浙江大学彭思达与具身多模态算法专家郝孝帅探讨具身导航。涉及本质、范式、挑战、交互等方面,还对未来5 - 10年发展做了展望。
具身导航:感知推理是上帝,还是执行控制是命门?| GAIR Live 023期预告
具身导航正从‘几何避障’向‘空间智能’跨越,当前领域经历范式变革。GAIR Live 023期线上圆桌将聚焦其前沿进展与落地问题,邀请两位专家拆解底层逻辑,还给出了核心议题、讨论精华预览及参与方式。