文件操作」共找到 784 篇相关文章

新闻资讯7

对话地平线前高管牛建伟:万亿参数大模型如何重塑具身智能

具身智能赛道分“VLA派”“智驾降维派”和“大模型派”。地平线前高管牛建伟认为VLA是弯路,主张用分层架构,以万亿参数“空间智能大模型”做大脑,VA小模型执行操作,目标是做物理世界的OpenClaw。

AI科技评论
产品应用8

3D版Nano Banana来了!AI修模成为现实,3D生成进入可编辑时代

2026年初市场关注3D生成领域,中国团队Hyper3D发布Rodin Gen - 2 Edit,实现3D模型局部编辑。它支持两种操作路径,将“3D生成”与“3D编辑”整合,还打通主流工作流,源于团队长期技术积累。

量子位
开源动态8

开源8300小时标注数据,新一代实时通用游戏AI Pixel2Play发布

随着AI在代码和图片生成领域成熟,研究人员开始关注其在游戏领域的表现。此前的专用模型缺乏跨游戏泛化能力,通用模型在游戏环境中表现不佳。为此,Player2研究员提出Pixel2Play模型,还开源了代码和数据集。

机器之心
开源动态8

不止是 Claude Code 平替:这个开源 CLI 还支持“多模型协作 + 子代理并行”

Kode 定位是在终端中完成代码库理解、文件编辑、命令执行等开发流程,有三大亮点:将多模型协作设为核心能力;支持 AGENTS.md 文档模式;终端体验好,有强大的补全系统。还介绍了使用方法和适用人群。

小华同学ai
产品应用7

快手可灵也吃上了香蕉,一通离谱prompt测试,好好玩要爆了

ChatGPT发布三周年,快手可灵AI视频「O1模型」登场,号称“全球首个统一多模态视频模型”。实测显示它能一站式搞定视频修改、镜头延展等操作,还推出了图片O1模型,在图片生成方面表现出色。

量子位
新闻资讯7

Atlas来了!ChatGPT嵌入浏览器,用谷歌的引擎,革谷歌的命

OpenAI推出ChatGPT Atlas浏览器,将ChatGPT嵌入浏览体验中心,具备智能体模式可自主执行操作,被视为对谷歌的宣战。此外,还有Perplexity的Comet、Opera的Neon及谷歌的Gemini版Chrome等参与竞争,但都基于Chromium架构。

新智元
开源动态8

本周推荐的5个超级6的Github开源项目!

文章推荐了5个Github开源项目。如htmx,能在纯HTML搞定多种交互,无需JS;Flow.Launcher可快速搜索文件、启动应用;Maple Mono是编程字体,中英2:1对齐;Trilium Notes是分层笔记神器;Hyprnote可实时转录会议内容。

开源先锋
新闻资讯7

首个为手机而生的通用Agent?!苹果做不到的事,“野路子”智谱抢先实现了

苹果预计2026年升级Siri实现自主行动,但完整落地的执行型Agent仍未推出。8月20日,智谱发布AutoGLM 2.0,宣称是全球首个可在手机用的Agent,开创‘Agent + 云手机 / 云电脑’范式,能代理操作高频应用。

AI前线
算法论文8

SimpAgent (ICCV2025 Highlight):上下⽂简化重塑GUI智能体,更少计算,更强性能

在多模态大模型加持下,纯视觉GUI智能体成通用操作智能体重要方向,但面临元素与历史上下文问题。哈工深和华为提出SimpAgent,从上下文简化建模入手,实现更快更强性能,工作被ICCV 2025录用。

AI科技评论
推荐文章8

AI 基础知识从0.1到0.2——用“房价预测”入门机器学习全流程

文章以“房价预测”为例,介绍算法工程师开发模型全流程,包括需求分析、数据收集、划分数据集等十步。详细讲解各步骤操作,如用均方误差衡量模型效果,还提及多种模型及调优方法,助开发者入门机器学习。

阿里云开发者