空间注意力提示」共找到 1135 篇相关文章

产品应用8

一个APP就能拍短片!人物、字幕、BGM……AI Agent统统自己搞定

剪映旗下内容创作Agent小云雀上线新功能,可文生数字人,还能根据提示词生成视频。它有“参考图生视频”玩法,能解决图片混剪难题。依托字节模型,创作门槛低,交付质量高,限时免费。

量子位
算法论文8

不靠海量数据,如何精准喂养大模型?上交Data Whisperer:免训练数据选择法,10%数据逼近全量效果

上海交通大学等团队提出 Data Whisperer,首个免训练的注意力驱动数据选择框架。它利用模型自身能力打分挑数据,无需训练与人工标注,用 10% 数据让微调效果逼近全量数据,在多方面领先传统方法。

机器之心
算法论文8

北大-灵初重磅发布具身VLA全面综述!一文看清VLA技术路线与未来趋势

GPT-4o等多模态基础模型发展,让研究者探索将智能延伸到物理空间,VLA模型受关注。北大 - 灵初联合实验室从动作词元化视角提出新框架,分析主流action token,还介绍了VLA发展趋势及面临挑战。

机器之心
算法论文8

开放世界任务成功率82%!美的攻克机器人泛化控制难题

美的AI研究院和华东师范大学联合提出ChatVLA - 2模型,引入动态混合专家架构和双阶段训练流程。真机实验显示其开放世界任务成功率达82%,远超现有方法,为通用机器人控制提供新思路。

量子位
算法论文8

ICML2025 | 揭示MLLM的图文联动推理能力

当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。

深度学习自然语言处理
算法论文8

除了prompting外,不动参数,如何改变模型行为?

文章指出传统提示工程控制大模型生成行为有缺陷,提出Steering Target Atoms (STA)方法。它用稀疏自编码器分解LLM高维表示,定位“原子知识组件”精准控行为,实验效果超现有技术,还能控制推理长度。

深度学习自然语言处理
产品应用7

回复:用 AI 辅导教学问题

家长询问用Gemini 2.5 pro的OCR功能辅助孩子预习九门课程的问题,包括撰写提示词、有无更合适AI方案、家长角色及评估学习成果等,回复给出对应建议,如没必要上传教材等。

宝玉AI
产品应用7

我把Claude变成了带记忆的人生教练,结果它比我还了解我自己|人生教练 Agent v2.1

作者将Claude打造成带记忆的人生教练,记忆功能让教练能回顾过往对话。其技术栈不复杂,相比传统教练优势明显。虽有缺乏情感共鸣等局限,但能发现认知盲区,未来有改进空间

AI 产品自由
产品应用7

TRAE 如何思考 AI Coding :未来的 AI IDE,是构建真正的「AI 工程师」

越来越多玩家涌入AI Coding赛道,TRAE作为国内首个AI Native的IDE有独特想法。其产品经理Leon认为未来是「AI+工具」模式,推出Solo模式,还分享相关思考、功能及场景,TRAE月活已超百万。

Founder Park
新闻资讯8

Karpathy 最新演讲精华:软件3.0时代,每个人都是程序员

Andrej Karpathy 在 YC 旧金山创业大会演讲,介绍软件从 1.0 到 3.0 的演变,指出软件 3.0 由 LLMs 驱动,自然语言提示成编程方式。还阐述 LLMs 特性、机遇与挑战,强调为 Agent 构建软件等内容。

歸藏的AI工具箱