「多模态Agent模型」共找到 9435 篇相关文章
首个可学习姿态对齐的视频扩散模型!StableAnimator++
当前人像动画扩散模型在人物身份一致性上表现不佳,复旦大学联合多团队提出StableAnimator++,它是首个可学习姿态对齐的视频扩散模型,能生成自然保真的人物动画,还在保持人脸一致性上做了改进。
从「悟道」到「悟界」,智源走进大模型的新时代
在2025智源大会上,智源研究院院长王仲远表示大模型技术演进未到终点。会上推出「悟界」系列大模型,包含Emu3、见微Brainμ等,推动AI从数字走向物理世界。还介绍了具身智能成果,且与企业合作打造生态。
香港科技大学、Manycor开源空间大模型,超3000颗星
香港科技大学、Manycore联合开源空间大模型SpatialLM,用于处理3D点云数据。它结合点云特征提取、对齐和语言生成,实现高效转换。研究团队经多种尝试选定基于点的方法及Sonata编码器,还选Qwen2.5 - 0.5B为基础模型。
AI操作网页:browser-use和AI大模型互动解析
文章深入解析开源框架browser - use与AI大模型互动方式。它能自动化在线任务,靠精巧prompt设计和不同类型Message输入实现高效交互,还总结出可用于其他大模型交互场景的技巧。
LeCun团队开源首个代码世界模型:能生成代码还能自测自修!传统编程模型一夜成古典
Meta FAIR推出全球首个代码世界模型CWM,它能生成代码、理解语义,还‘懂得’代码执行,能模拟运行过程。在多个代码与推理任务表现出色,开源代码、训练细节等,不过目前仅支持Python。
OpenAI新Agent遭中国24人初创团队碾压!实测成本、质量全输惨,海外用户:中国Agent代差领先
昨日凌晨,OpenAI推出ChatGPT Agent新功能,标志其踏入“智能体人工智能”领域。虽官方称该功能性能先进,但实际效果有局限。海外网友对比发现,它被中国24人初创团队产品Genspark等碾压。
OpenRouter模型7月排名:谷歌遥遥领先,DeepSeek 令牌份额占比超越Anthtropic
OpenRouter公布7月模型排名,按模型令牌份额占比,谷歌以43.2%遥遥领先,DeepSeek 19.4%超Anthropic,OpenAI仅5.9%。编程领域Claude sonnet 4占比第一,谷歌Gemini 2.5pro进步大。
The Batch:841 | 大语言模型正在纠正历史遗留的不公
美国北加州旧不动产契约含种族歧视条款,虽已非法但人工筛查耗时久。斯坦福和普林斯顿研究团队微调大语言模型识别圣克拉拉县契约中的歧视条款,模型可理解上下文,结果经律师确认,研究成果已开源。
RL在Agentic Reasoning中的作用:拨开迷雾,看清本质
近年大语言模型在推理任务能力惊人,但使用外部工具存挑战。传统SFT无法让模型自主调用工具,强化学习虽被引入,但在智能体推理中面临训练效率、稳定性和泛化能力难题。论文从多维度解构智能体强化学习,提出有效方法。
实测丨HeyGen开源HyperFrames,让AI Agent用HTML做视频
复杂视频剪辑工具对非专业人士和AI Agent不友好,HeyGen开源的HyperFrames是视频渲染框架,可让AI Agent用HTML做视频。该项目更新频繁,有HTML原生、为AI设计等特点,文末附项目链接。