「多模态条件控制」共找到 1472 篇相关文章
尖峰对话17分钟全记录:Hinton与周伯文的思想碰撞
7月26日,人工智能教父Geoffrey Hinton与周伯文教授进行17分钟对话,谈及AI多模态大模型前沿、“主观体验”和“意识”等话题。Hinton认为当今多模态聊天机器人已有意识,还探讨了训练善良AI及AI推动科学进步等问题。
从0开发大模型的17种Agent架构演进详细拆解
文章详细拆解从0开发大模型的17种Agent架构演进,介绍各架构解决的问题、状态、拓扑、路由、失败模式等,指出Agent架构本质是控制流设计,还给出架构选择建议及判断新架构的方法。
EMNLP 2025 Oral|检索增强 + 两阶段微调:剑桥提出有害内容检测大模型RA-HMD,性能SOTA
多模态有害信息检测是网络内容安全治理的重难点,多模态模型在有害内容检测上有瓶颈。剑桥大学团队提出RA - HMD框架,通过两阶段微调与结构增强,结合检索增强,提升检测性能,被EMNLP 2025接收。
AI修真的一年:学者们怎么看“真智能”?|甲子光年
甲子光年在年终盛典对话三位学者,探讨AI“真假智能”。学者们提及强化学习、推理、多模态等技术突破,分析研究路径,还谈选择标准与未来期待,指出AI是工程实践命题,真与假关乎信念选择。
RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力
多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。
社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型
Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持单/多向量表示。介绍了架构、上手指南等。
GEO中,llms.txt是个啥?
GEO中llms.txt是新兴网络标准提案,分提案A(访问控制)和提案B(推理指导)。提案A类似robots.txt,控制内容用于模型训练;提案B是Markdown文件,助LLM理解网站。作者整理指南分享,盼业内出标准。
vivo突破手机AI部署难题,绕开MoE架构限制,骁龙8 Elite流畅运行|ICCV 2025
在AI多模态时代,‘让大模型上手机’成焦点。现有MLLM在手机端部署有难题,vivo AI研究院等团队提出GenieBlue方案,绕开MoE架构限制,在骁龙8 Elite芯片手机流畅运行,保持语言性能同时实现多模态表现。
The Batch: 969 | 谷歌的机器人模型有了腿
谷歌发布 Gemini Robotics 2(GR2),能将相机图像和文字指令转为机器人关节控制命令,可同时控制人形机器人腿、躯干、手臂和手部,简化模型训练和设计,不过谷歌未公布其基础模型等信息。
The Batch: 944 | Llama 之后的时代
Meta发布首个AI模型Muse Spark,是多模态推理模型,在部分健康和多模态测试领先,编程与智能体任务有不足。Meta披露技术细节少,该模型基准测试有竞争力,但其从开放转向封闭引开发者担忧。