手机智能体」共找到 5206 篇相关文章

开源动态8

给几何图片写标题就让AI更聪明,UIUC发布高质量可泛化几何数据集

随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理力成研究热点。现有方法泛化力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。

机器之心
产品应用7

企鹅终于跟进了:OpenClaw 接入企微,一个企微群,我管住了 Win、Mac、机,还@不同AI 专家

微信不开放,企业微信却允许 OpenClaw 接入。其接入简单,还具特色机制与主动性通知。文中介绍了 OpenClaw + 企微等玩法,如多 Bot 群聊、跨设备控制等,最后给出企微接入 OpenClaw 保姆教程。

AI进修生
产品应用7

产品经理也“开发”需求?淘宝信息流从需求到上线的AI端到端实践

淘宝推荐信息流业务被“需求多、技术栈杂、协作慢”困扰,上线周期长。WaterFlow这一AI驱动的端到端开发实践,让部分需求两天内上线,产品经理也参与。文章揭秘其落地及协作模式改变,还展示了实践效果。

阿里云开发者
产品应用7

我用“悟空”做了应聘和OPT Skills,预测上班和创业成功率丨龙虾OPT创业笔记

钉钉发布全球首个企业级 Agent 平台“悟空”,它是AI产品进入下一个时代的探索,接入多平台真实数据,操作公司流程。通过开发者应聘、跨境电商、知识博主等场景案例,展现其力,还预测创业成功率,解决企业使用AI的安全痛点。

鲸选AI
算法论文8

首创像素空间推理,7B模型领先GPT-4o,让VLM像人类一样「眼脑并用」

当前主流视觉语言模型(VLM)依赖文本token间接翻译视觉信息,缺乏直接视觉操作力。滑铁卢大学等团队提出「像素空间推理」范式,让VLM像人类一样「眼脑并用」,在四大视觉推理基准测试中,7B的Pixel - Reasoner表现碾压GPT - 4o等。

量子位
开源动态8

AI杀入美股,DeepSeek又是第一!港大90后开源,AI股神人人都

在港大「AI - Trader」项目中,DeepSeek以9.68%收益率击败GPT、Claude等顶级模型,成为在美股自主盈利的AI交易系统。项目开源,还暴露出AI不同「性格」,显示市场是AI终极试金石。

新智元
开源动态8

30.9K Star牛啊!!再见了PD,不越狱也装,支持几十种系统,苹果全设备通用!

在苹果生态运行其他系统,Parallels Desktop 收费且移动设备难装。开源工具 UTM 免费,基于 QEMU 构建,支持多架构和系统,操作界面简洁,外围设备支持强,苹果全设备通用。

开源先锋
开源动态8

刚开源仅3天狂揽4.9K star,轻量超高效版OpenClaw,10美元硬件就跑!

OpenClaw火遍全网但硬件要求高、成本不菲。新开源的PicoClaw是其轻量替代方案,由Sipeed开发,内存占用少、启动快、成本低、便携性强,安装简单,功多样,刚开源就成热议新星。

开源先锋
算法论文8

公里级场景也稳住了,国产团队把长视频3D重建又往前推了一步

浙江大学、地平线机器人和之江实验室的新工作 Scal3R 要解决长视频 3D 重建问题。它借助 test - time training 技术,设计全局上下文模块和同步机制,提升长序列重建稳定性和精度,处理超万帧几千米的场景。

机器之心
产品应用7

给 AI 一张陶罐碎片图,它还原破裂过程吗?Minimax H3 vs Seedance 2.0 Fast 实测

文章实测 MiniMax H3 和 Seedance 2.0 Fast,给模型一张破碎陶罐图,让其生成破碎过程视频。分析 H3 技术逻辑,对比两模型效率、质感和物理细节等差异,指出开放与闭源模型的特点及视频模型待解决的问题。

AI科技评论