「显示技术」共找到 4051 篇相关文章
打破资源瓶颈!华南理工&北航等推出SEA框架:低资源下实现超强多模态安全对齐
本文介绍北航彭浩团队的 SEA 框架,针对多模态大模型低资源安全对齐难题,用合成嵌入替代真实数据,突破资源瓶颈。还构建 VA - SafetyBench 评估安全风险,实验验证了 SEA 低资源、高泛化优势。
炸裂!谷歌I/O大会王者归来:Gemini“世界模型” 初现,搜索“换脑”,一句话制作原声电影
谷歌I/O 2025大会发布大量技术,虽Gemini 2.5 Ultra未到,但Pro有革新。还推出新模型、代理工具,多模态能力提升,搜索重塑,加入AI眼镜开发,倾尽全力发展AI生态。
AI实力榜大洗牌!OpenAI谷歌强势领跑,Anthropic节节败退
Poe最新报告显示,2025年1 - 5月AI各领域市场份额大洗牌。OpenAI和谷歌势头猛,Anthropic掉队。文本生成、推理、图像等各领域竞争激烈,企业需搭建评估体系,按需选模型。
ICML 2025 Spotlight|南洋理工陶大程教授团队等提出基于RAG的高分辨率图像感知框架,准确率提高20%
南洋理工陶大程教授团队等合作,为解决多模态大语言模型处理高分辨率图像问题,探索 RAG 应用可行性,提出 Retrieval-Augmented Perception (RAP) 框架,在多任务上提升性能,已被 ICML 2025 接收。
CMU朱俊彦等上新LEGOGPT,一句话就能搭乐高,网友:复杂零件行不行?
近日,CMU助理教授朱俊彦团队带来基于文本生成3D乐高的大模型LEGOGPT,输入文本即可快速拼好乐高,生成的乐高还有纹理和颜色。研究人员让机器臂组装模型,结果完美。该模型仍有局限,团队正努力扩展能力。
新SoTA方法RM-R1:让reward model对评分说出原因!超越GPT4o
过去模型‘黑箱打分’不透明、不灵活。论文提出ReasRM,经两阶段训练,让奖励模型像人类先思考再打分。它能分任务类型、动态奖励,实验中碾压GPT - 4,小模型逆袭,团队已开源6个模型。
SGLang Team:在 96 个 H100 GPU 上部署具有 PD 分解和大规模专家并行性的 DeepSeek
本文介绍 SGLang 团队在 96 个 H100 GPU 上部署 DeepSeek 的方法。利用 PD 分解和大规模专家并行性,SGLang 实现高吞吐量,成本低。博客探讨并行设计、优化方法,所有组件开源,也指出了当前局限与未来方向。
这一次,真不是狼来了,旧时代一夜终结「GPT-6 Astra与特斯拉Cybercab同日上线」
OpenAI总裁称迎来AGI时代。GPT - 6 Astra实现前所未有的对齐,理解意图大幅提升,能快速完成电脑上的事。投资人实验中,它用一句话构建微型文明。同日特斯拉Cybercab提供出行服务,旧时代或终结。
惊讶!!!3.2 万 Star OpenViking,让你的原地起飞!!!
OpenViking有3.2万Star,它把记忆、文档、提示词等上下文统一成可浏览地址空间,设计三层信息按需加载,检索留轨迹,还接入多种工具。不过它处Alpha阶段,用前要考虑许可证。
V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间
近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文中提出视频表征自编码器 V-RAE。它以冻结的视觉基础模型为编码器压缩视频特征,还引入轻量级模块聚合信息。经实验验证,其在视频生成和预测上性能出色。