「多学科优化」共找到 5050 篇相关文章
UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力
大型多模态模型在复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在多模态基准上表现优异,还解决了KL黑客问题。
单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器
人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。
Proactor AI:首个自主行动的AI 智能体,无需唤醒,就能主动识别对面是个骗子
Proactor AI v1.0发布,号称是世界首个「自主行动」的AI队友。它能感知、思考并自主行动,如识别骗局。还提供主动式AI服务,应用场景广泛,用户反响热烈,带来人机交互范式转变。
集成20+先进算法,优于GPT-4o,自主因果分析智能体来了
加利福尼亚大学圣迭戈分校研究团队提出自主因果分析智能体 Causal - Copilot,集成超 20 种算法。它解决因果分析使用门槛高、预训练模型有局限等问题,性能优于 GPT - 4o ,已开源邀全球研究者参与。
大模型时代,通用视觉模型将何去何从?
过去通用视觉模型(VGM)是研究热点,想实现‘视觉模型大一统’。但大语言模型发展使研究热点转移,视觉‘独立性’被重新定义。清华鲁继文团队综述梳理其进展,探讨现状、挑战与应用潜力。
刚刚,何恺明官宣入职谷歌DeepMind!
AI大神何恺明正式入职谷歌DeepMind担任杰出科学家,同时保留MIT终身副教授身份。他因提出ResNet名震江湖,研究成果多且获奖无数,今年也成果不断,将助力DeepMind的AGI目标。
ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示大模型如何“踩雷”领域指南规则
这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流大模型指令遵循能力不佳,尤其数学推理挑战大,为模型迭代提供评估基准。
Lovart的开源平替产品,完全本地免费的AI设计Agent。
Lovart是热门AI设计Agent但使用成本高,现找到开源平替项目Jaaz。它接OpenAI绘图API,支持Comfyui等本地工具,能免费本地使用,功能丰富,还将推视频生成功能。
三大云厂同时瘫了?Cursor、ChatGPT跟着倒下!网友:整个互联网都要废了
北京时间昨天晚上,AWS、谷歌云、Azure 和 Cloudflare 同一时间发生中断,谷歌云服务全球瘫痪 3 小时,导致旗下及第三方诸多服务受影响。Spotify、Cloudflare 等也受波及,有人猜测是谷歌 Chemist 服务故障所致。
谢赛宁苏昊CVPR25获奖!华人博士王建元一作拿下最佳论文
CVPR 2025奖项揭晓,谢赛宁、苏昊获青年学者奖。最佳论文《VGGT: Visual Geometry Grounded Transformer》由王建元一作。还介绍了最佳学生论文及4篇荣誉提名论文的亮点与应用前景。