「视角移动功能」共找到 1840 篇相关文章
DreamArt!只需一张图,生成可动的可交互物体
生成可动物体是具身智能等领域关键挑战,现有方法有局限。北大团队提出DreamArt框架,从单张图像生成可交互可动物体,经三阶段流程,表现优于基线方法,不过也存在生成不符物理规律等问题。
马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?
Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。
仅2G内存可跑,刚刚,谷歌开源Gemma 3n,端侧原生多模态!
谷歌全面发布Gemma 3n,将多模态AI功能带入边缘设备并在Hugging Face开源。它原生支持多模态输入输出,针对设备端优化,内存占用低,采用开创性架构,Gemma系列质量也不断突破。
Nature报道:谷歌新模型1秒读懂DNA变异!首次统一基因组全任务,性能碾压现有模型
谷歌DeepMind团队推出生物模型AlphaGenome,能从1兆碱基DNA序列中预测数千种功能基因组特征,评估变异效应。它统一多任务,性能超现有模型,是生物领域里程碑,将助力理解疾病。
Google 错放大招!Gemini CLI 开源+免费,Claude Code瞬间不香了......
Google悄悄发布开源免费的命令行AI开发工具Gemini CLI,免费用户每天1000次请求、每分钟60次。它功能强大,是完整AI代理,还与Gemini Code Assist配合,或改变coding游戏规则。
字节开源多模态复杂文档解析模型!Dolphin:页面与元素并行解析,精准解析复杂文档!
多模态AI与文档解析兴起,传统OCR解析复杂文档常出错。字节跳动开源多模态模型Dolphin,通过两阶段机制精准解析,有多种功能,安装使用友好,适用于多场景,降低了复杂文档解析门槛。
Arc浏览器创始人复盘:为何放弃百万用户及产品,押注AI浏览器?
Arc浏览器曾是新星,有上百万高粘性用户。2024年10月创始人透露将开发新AI-Native浏览器Dia,Arc进入维护状态。创始人复盘Arc错误,阐述转型原因,认为传统浏览器将消亡,Dia有机会成桌面端主流AI界面。
【万字长文】大模型开源开发全景与趋势解读
本文以蚂蚁开源团队视角,基于OpenDigger数据,分析大模型开源开发生态。呈现2025年全景图,涵盖135项目。指出训练、推理、应用侧主导领域,还探讨生态趋势、项目兴衰及近期厂商动态。
这样更公平:用jina-reranker-m0为多模态文档打分重排
文章指出多模态搜索领域给文档综合评分难,因文本与图像评分缺乏可比性。2025年4月发布的jina - reranker - m0可解决此问题,其两阶段检索流程能显著提升召回率,对多模态AI系统设计有启发。
豆包上了视频通话后,我妈再也不用攒着问题等我回家了。
豆包上线视频通话功能,作者第一时间告知妈妈使用。妈妈借助豆包解决了重置手机、识别花等问题,还帮外婆安装。视频通话互动陪伴感强,降低使用门槛,让亲人享受科技温暖。