「独立探索」共找到 900 篇相关文章
起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机”
当红的“豆包手机”技术详情被证实,其助手技术基于字节自研的UI-TARS模型,该模型初代开源后引发热议,“豆包手机”用的闭源版性能更优。UI-TARS历经迭代,成果成热门开源多模态智能体。
陶大程技术博客首发:从像素复刻到行动控制,具身世界模型的底层逻辑探索|甲子光年
今年世界模型成AI热点,通用世界模型追求像素逼真,具身世界模型不同,其使命是支撑行动。文章拆解具身世界模型底层逻辑,分享开悟世界模型的技术设计与实践思考。
创新中心 | 2025首届“幻镜”AI视听测评季成果在京发布,探索AI视听领域建立科学测评体系
2025年10月28日,“人工智能赋能精品创作沙龙”暨首届“幻镜”AI视听测评季成果发布会在京举办,活动旨在为AI视听领域建科学测评体系。会上公布测评结果、优秀作品片单,发布研究分析报告。
曾让 Adobe 豪掷千亿,如今要独立上市了!招股书疯狂点名 AI 150 次,新产品对标 Lovable
网页设计工具开发商 Figma 申请 IPO,招股书提“AI”超 150 次,既视其为“创意加速器”,也认为是“潜在威胁”。该公司业务增长强劲,今年扩展工具库,虽 AI 投入短期内有负面影响,但仍会加倍投入。
“甲方快乐模型”诞生,拿下平面设计新SOTA!多条件一键生成,还能独立调整元素 | 复旦&字节
复旦大学和字节跳动团队联合提出CreatiDesign新模型,可实现高精度、多模态、可编辑的AI图形设计生成。它解决了以往方法在处理图形设计时的难题,在多维度评估基准上表现出色,还支持多轮编辑。
白嫖微软开源Web Agent,独立开发者的第二双手:自动刷网页、跑脚本、盯进度,全交给 Magentic-UI
Magentic-UI是微软开源的Web Agent界面,能控制浏览器、执行代码等,解决长流程、重复且让人不放心全交给AI的任务。它可视化操作,有可复用计划图库等亮点,使用体验好,适合特定开发者。
o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界
GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。
教你用 Lovart 生成超炫 PPT 视频封面
受海外老哥启发,探索出用 Lovart 生成动态 PPT 背景的提示词,提示词放评论区。
不会搭工作流?ComfyUI-Copilot迎来更新,说话就能搞定!
几个月前阿里推出ComfyUI - Copilot提升ComfyUI易用性与效率。近期它迎来更新,用智能节点推荐等功能解决新用户难题,核心采用分层多智能体框架,还具备参数探索等功能。
大模型终于通关《宝可梦蓝》!网友:Gemini 2.5 Pro酷爆了
Gemini 2.5 Pro在直播中通关《宝可梦蓝》,谷歌CEO官宣。文中介绍其通关过程、玩游戏基本步骤,还探讨宝可梦对大模型的挑战,谷歌将继续探索,网友提议用通关宝可梦测试大模型 。