「跨语言能力」共找到 4193 篇相关文章
真正的一句话修图:Gemini 用香蕉模型给出了图像生成的分水岭
Google新模型Gemini 2.5 Flash Image可在AI Studio体验。它有多图融合、角色一致性等能力,能实现自然语言编辑图像,速度快、价格低、API可用,虽有中文体验等问题,但有望让AI视觉工具进入工程化时代。
支付宝 AI 出行助手高效研发指南:4 人团队的架构迁移与提效实战
本文介绍支付宝AI出行助手研发历程,其集成多种出行功能,基于xUI + KMP框架搭建。分享研发实践、挑战与策略,如迁移基础能力、卡片生态,适配标准框架,还提及KMP应用及数据度量体系,取得业务和研发效能成果。
视频理解新标杆,快手多模态推理模型开源:128k上下文+0.1秒级视频定位+跨模态推理
快手开源能看懂视频并跨模态推理的大模型Keye-VL 1.5,其有时序定位、描述和推理能力,跑分领先。采用三段式架构和Slow-Fast编码策略,经四阶段预训练和多阶段后处理,团队成果多,推动多模态技术落地。
从亚太到欧美,阿里云瑶池数据库凭何成为中企出海的技术底气?
在中企出海迈向‘深水区’时,阿里云瑶池数据库成关注焦点。它涵盖多版块,能提供全链路生命周期服务。对话负责人薛菲可知,其满足出海数据库需求,在多场景表现出色,融入AI能力,获国际认证,为中企出海提供底气。
豆包的新身份曝光:在国际艺术展当起了“AI讲解员”
文章讲述作者在浦东美术馆「AI与艺术」豆包讲解体验日活动的经历,实测豆包作为AI讲解员的业务水平,如筛重点、实时讲解、补知识,还揭秘其靠豆包大模型1.8的多模态处理等能力任职。
重磅!DeepSeek再开源:视觉即压缩,100个token干翻7000个
DeepSeek-OCR模型探索视觉-文本压缩边界,用少量视觉token解码出10倍以上文本信息。它在OmniDocBench基准上表现超GOT-OCR2.0,为LLM长上下文问题提供方案,还能处理多类图像与近100种语言。
无需训练的LLM对齐方法综述
大型语言模型应用引发担忧,传统微调方法有短板,免训练对齐(TF Alignment)应运而生。本文是首篇系统综述TF对齐技术的论文,提出三阶段分类框架,实验显示TF方法优势明显,还指明未来研究方向。
通勤路上修故障?钉钉机器人+ OOS AI 助手实现 7×24 小时运维自由
传统运维依赖电脑,突发故障时受限。阿里云OOS AI助手结合钉钉机器人,实现免登录、跨设备、秒级响应的运维操作。如运维工程师张伟深夜在家用此组合10分钟解决故障,还介绍了使用和配置方法。
诺奖得主实验室走出的中国团队,正用世界模型重构生命分子设计
过去 AI 分子设计多困于‘模态孤岛’,难以跨模态理解和设计。诺奖得主实验室走出的中国团队推出 ODesign 开源项目,将多模态分子纳入统一框架,展现跨模态迁移能力,团队创立英灵殿科技欲重构药物研发流程。
柔体操作最缺数据、最怕仿真失真?新研究让布料物理真实再现
上海AI Lab的SIM1研究实现布料物理性质真实再现,解决仿真数据与真实场景对齐问题。它提出real - to - sim - to - real新范式,通过闭环流程生成数据,能扩展轨迹、提升泛化能力,有望重新定义机器人数据天花板。