视觉设计」共找到 1883 篇相关文章

产品应用7

京东「再造」京东

京东推出「京东AI购」App,页面极简,仅留对话框,能像助理般提前感知需求。它兼顾快思考与慢思考场景,同一架构兼容两种决策方式,对话框设计降低决策成本,产品有分寸感,是探索未来电商的先锋。

机器之心
算法论文8

SimpAgent (ICCV2025 Highlight):上下⽂简化重塑GUI智能体,更少计算,更强性能

在多模态大模型加持下,纯视觉GUI智能体成通用操作智能体重要方向,但面临元素与历史上下文问题。哈工深和华为提出SimpAgent,从上下文简化建模入手,实现更快更强性能,工作被ICCV 2025录用。

AI科技评论
产品应用7

Prompt | 人生金句炼金术师

作者分享“人生金句炼金术师”提示词,用其将平凡瞬间转化为哲理金句,如“想减肥没开始”“等红绿灯”等场景。给出不同风格卡片提示词,实测Gemini 2.5 Pro效果更好,还介绍了动态视觉图谱提示词。

AI进修生
算法论文7

多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合

清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。

量子位
推荐文章7

什么是系统提示词?如何逆向提示词?

大语言模型启动时会接收系统提示词,决定其角色、回答风格与安全边界。提示词逆向是试图获取或绕过该提示的行为。本文介绍其作用、逆向手法及开发者防御措施,助于安全使用和设计大模型。

AI Reading Hub
算法论文8

ICML 2025 | 注意力机制中的极大值:破解大语言模型上下文理解的关键

ICML 2025新研究揭示,在使用RoPE的现代Transformer模型里,注意力机制Q和K表示有集中极大值,V表示无此模式。研究通过实验明确极大值与上下文知识理解的联系,对模型设计、优化和量化有重要启示。

深度学习自然语言处理
开源动态7

小红书发布 SWE-Bench Mobile:当 AI Agent 面对亿级用户 App 代码库,最高通过率仅12%?

小红书联合多科研机构发布 SWE-Bench Mobile,它是首个还原‘端到端’开发流程的基准,以小红书 App 实际任务为核心。评测显示,AI Agent 在移动端开发能力上限低,架构设计比模型本身重要,简单提示策略效果更好。

InfoQ
算法论文8

让AI生成视频「又长又快」:Rolling Forcing实现分钟级实时生成

南洋理工大学与腾讯ARC实验室联合研究,由博士生刘坤昊等完成,提出Rolling Forcing方法,通过滚动窗口联合降噪等创新设计,突破实时长视频生成瓶颈,实现分钟级实时生成,还支持交互控制,但仍有优化方向。

机器之心
开源动态7

Crossplane 2.0 发布:在云基础设施之上全面支持应用管理

Crossplane 开源项目发布 2.0 版本,将管理范围从云基础设施拓展到应用与基础设施协同编排。解决了基础设施与应用需分开管理的问题,新增应用支持,改进组合资源,采用命名空间优先设计,还引入新 Operation 类型。

InfoQ
算法论文8

多模态后训练反常识:长思维链SFT和RL的协同困境

华为与香港科大研究发现,多模态视觉语言模型中,长思维链SFT与RL组合难协同增益。研究引入难度分类方法构建数据集,分析各方法表现及组合策略困境,还给出实验发现与未来研究方向。

机器之心