手机智能体」共找到 5230 篇相关文章

开源动态8

图像分层生成:新加坡国立大学和Lowart AI实现了图像可编辑的PSD文件输出

新加坡国立大学和Lowart AI发布OmniPSD,利用Diffusion Transformer架构解决分层图像生成与拆解难题,实现可编辑PSD文件输出。它通过文本生成分层PSD文件,也拆解单张平面图像,解决AI生成图像难编辑痛点。

AIGC开放社区
产品应用8

机器人“会用”了!银河通用首破掌任意朝向旋转难题,拧螺丝、砸钉子样样精通

银河通用推出的灵巧神经动力学模型DexNDM,让灵巧实现从动到用的飞跃。它首次突破掌任意朝向旋转难题,实现跨物体、跨姿态稳定操作,助力机器人迈向精细操作,推动灵巧操作走向生产力基础设施。

量子位
算法论文7

重塑你的vlog!PickStyle打造稳定的视频风格迁移模型

Pickford提出PickStyle,这是基于扩散模型的视频到视频风格迁移框架。它结合上下文–风格适配器和CS–CFG机制,在保持画面连贯时准确迁移风格,还避免闪烁等问题,不过也继承了基础模型部分缺陷。

带你学AI
新闻资讯8

ChatGPT语音杀入桌面!你负责动嘴,一群AI负责干活

近日OpenAI将ChatGPT语音功正式引入桌面版,其底层是新一代语音模型GPT - Live。大佬们看好语音输入,因其高带宽传递上下文。该功不仅闲聊,还可调度智体,OpenAI想让ChatGPT成AI工作操作系统。

新智元
产品应用8

Luma Uni-1.1 API开放,图像模型榜单第三,文字渲染直逼GPT image 2

今年图像生成模型迭代快,海外AI初创公司Luma将统一图像模型Uni - 1升级到1.1版并开放API。它在榜单排名前三,价格与延迟低,有诸多品牌客户接入。展示了多场景应用效果,技术路线独特,定价有优势。

机器之心
产品应用7

龙虾开始自己拍电影了:我在 LibTV 里看着它从一句话做到成片

作者试用 AI 视频产品 LibTV,仅给 Claude Code 发一句话“「黑神话哪吒」视频制作”,约 10 分钟就得到视频初稿。LibTV 搭好 0 到 60 的地基,留下可继续创作的画布,成本低还多尝试,最后仍需人把关。

AI产品自由
开源动态8

港大开源 Paper2Slides,一条命令,把论文变成专业幻灯片!

在AI辅助办公赛道,PPT生成一直是竞争热点,但存在好看不好用、好用不准确的问题。港大开源的Paper2Slides项目,一条命令把论文转成专业幻灯片,还做海报,解决了AI幻觉问题。

开源星探
新闻资讯7

OpenAI新Agent遭中国24人初创团队碾压!实测成本、质量全输惨,海外用户:中国Agent代差领先

今日凌晨,OpenAI 推出 ChatGPT Agent 新功让 AI 助完成多步骤任务。虽官方称其性先进,但实际效果有局限。海外用户将其与中国团队产品对比,发现中国 24 人初创团队产品成本、质量更优。

AI前线
推荐文章7

万字长文!大模型LLM推理优化技术总结

文章围绕大模型LLM推理优化技术展开,先介绍LLM推理各阶段、批处理、KV缓存等概念及内存需求,再阐述模型并行、注意力机制优化、模型优化和模型服务等技术,如Pipeline并行、MQA、量化、动态批处理等。

OpenMMLab
开源动态8

Transformer开始构建三维世界:开源模型几张图片秒级生成可探索3D场景

影溯将最新研究成果做成免费3D捕捉工具Crystal空间相机,背后技术QuerySplat已开源。其模型Topos - Lite改变组织三维空间方式,少量图片就秒级生成3D场景,还扩展容量。影溯团队经验丰富,技术应用场景广。

机器之心