「多语言混用」共找到 4829 篇相关文章
智源新出OmniGen2开源神器,一键解锁AI绘图「哆啦 A 梦」任意门
2024年9月智源研究院发布统一图像生成模型OmniGen,获社区好评。近期OmniGen升级为OmniGen2,增强多方面能力且全面开源。它采用新架构与策略,有反思机制,玩法丰富,还推出新基准优化部署。
2025谷歌研究学者计划名单:吴佳俊、Mamba作者Albert Gu、Tri Dao等获奖
本周四,2025年谷歌研究学者计划获奖名单公布。该计划为鼓励与科研人员合作、推动科技进步而设,申请人需为高校教职人员,获奖者最高可获6万美元奖金。本文列出了部分获奖华人学者信息。
生图效果媲美GPT-4o,一键搞定各类视觉生成任务丨港科广&字节全新框架
港科大(广州)和字节联合推出开源框架ComfyMind,它是通用视觉生成框架,能统一处理主流视觉生成任务。其性能超现有开源方法,媲美GPT - 4o - Image,还介绍了架构、接口等及性能评估情况。
谷歌CEO劈柴震撼预言:2030年AI直逼超人智能,80亿人认知被颠覆
谷歌CEO劈柴在采访中称AI是人类历史上影响最深远的技术,进步极快且能力上限未知。他谈到AI会释放80亿人认知潜能,还从多方面阐述了AI对各领域的影响及未来发展。
ICML 2025|趣丸研发新型人脸动画技术,声音+指令精准控制表情
广州趣丸科技团队提出新颖肖像驱动框架Playmate,能根据音频和控制条件生成高质量肖像视频,精准控制表情和姿态。成果被ICML 2025收录,代码开源筹备中,在多方面优于现有方法。
谷歌 AI Studio 实时视频对话终于支持中文了!屏幕共享+语音,Gemini 2.5 Flash 原生音视频加持。
谷歌AI Studio实时视频对话支持中文,有Gemini 2.5 Flash原生视频对话模型。使用方便,还提供多种音色,有让模型在无声时发音视频等功能,可用于设计、学习、修电脑等场景。
阿里的 AI IDE 登场了,这事绝对有戏
阿里云正式发布通义灵码的AI原生IDE:Lingma IDE,免费开放,核心功能和Cursor对齐且速度更快。其整合Qwen、DeepSeek系列模型,有感知引擎等亮点,还有企业版适合国内公司。AI编程竞争激烈,阿里有机会做成。
狂赚 21.6K star!超牛的Cursor免费平替项目,隐私友好、功能超强,真的香!
开源君分享了开源AI代码编辑器Void,它是基于VS Code魔改的「开源版Cursor」,保留VS Code优点,AI辅助编码出色。在Github获21.6K star,有隐私保护等特色,操作简单易上手。
仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!
剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。
将对话界面直接引入Web,微软开源NLWeb,实现ChatGPT级别搜索
微软 Build 2025 开发者大会上,开源项目 NLWeb 受关注。它简化网站自然语言交互界面开发,原生支持 MCP,能让任意网站变智能应用平台,还可调用廉价模型,使用方便。