多语言能力」共找到 7037 篇相关文章

新闻资讯7

反超Nano Banana!OpenAI旗舰图像生成模型上线

OpenAI发布图像生成模型GPT - Image - 1.5,有更严谨指令遵循、精确编辑等亮点,速度快4倍。玩法类似Nano Banana,在指令遵守和精确编辑上有提升,将在ChatGPT面向所有用户推出,价格下降。但在世界理解能力上遭质疑。

量子位
新闻资讯7

给 Agent 接搜索功能,有哪些「坑」需要特别注意?

搜索是AI产品标配,但给AI接搜索不易,给人用和给AI用的搜索差异大。信息检索质量影响Agent推理与任务完成度。邀请小宿科技相关人员聊给Agent接入搜索能力,10月30日20点线上闭门活动可扫码报名。

Founder Park
新闻资讯8

谷歌新版Gemini一夜端掉UI:单HTML文件复刻macOS,成功率100%

谷歌新版Gemini 3.0 Pro能力惊人,几行提示词就能在浏览器复刻苹果macOS,还能生成网页版Windows、Linux,功能完整且能一次生成,代码已公开。不过有网友指出这只是模拟环境。业内推测其或在未来几个月发布。

量子位
开源动态7

Google Design.md:一键复刻60+大厂设计规范 | 设计界的事,能叫偷吗?

今天分享Google Stitch团队提出的DESIGN.md标准,单文件搞定网页设计。62个真实网站视觉语言对应的DESIGN.md可在https://getdesign.md/获取,它也是开源项目。放入项目根目录后,AI编程助手可读取生成风格一致的UI组件。

AI进修生
推荐文章8

当顶级视频模型半衰期只有 30 天,fal.ai 为什么收入反而一年增长 60 倍?

在生成式媒体技术发展背景下,fal.ai 作为生成式媒体 infra 公司迅速崛起。它通过统一 API 与云端平台提供模态模型调用能力,2025 年收入增长 60 倍并完成融资。文章解析其如何构建护城河及对行业发展的判断。

海外独角兽
产品应用7

实测可灵O1,AI视频界的Banana也来了。

可灵推出全新模态视频大模型可灵O1,融合种视频生成与修改能力。实测显示,它能实现视频内容增删、特定内容修改、扣绿幕、动作迁移、风格更改等功能,虽有局限,但开启用嘴改视频新时代。

数字生命卡兹克
开源动态8

美团视频生成模型来了!一出手就是开源SOTA

美团开源视频生成模型LongCat - Video,参数13.6B,支持文生/图生视频,时长可达数分钟,生成视频真实自然,文生视频能力顶尖,整体质量优,采用MIT协议。还介绍了其功能、技术原理及美团此前的AI成果。

量子位
开源动态8

模仿人类推理修正过程,阶跃星辰提出形式化证明新范式 | 开源

阶跃星辰发布并开源形式化定理证明大模型 StepFun-Prover-Preview-7B 和 32B。采用两阶段监督微调、工具集成强化学习及 RL 与 SFT 迭代循环优化等策略,在基准测试集表现佳,还展示个证明案例。

量子位
产品应用8

通向L3的正确范式?理想i8全球首发VLA高阶辅助驾驶,我们帮你试了试

本周二,理想全新纯电SUV理想i8上市,其搭载的VLA辅助驾驶系统受关注。理想发现端到端数据驱动升级有局限,VLA架构改进让系统有思维、沟通等能力,还带来平顺性等提升,且研发各方面能力强。

机器之心
新闻资讯8

刚刚,OpenAI 发布了GPT-5 前菜:ChatGPT Agent

OpenAI发布ChatGPT Agent,它是统一智能代理系统,融合种功能与工具,能动态选处理路径。在测试中表现佳,采用强化学习微调新架构。使用体验似与人协作,OpenAI采取安全措施,还探索商业、分批开放,业内看法不一。

AGI Hunt