信息图生成」共找到 2952 篇相关文章

开源动态8

字节开源了一款多模态神器!BAGEL上线,超越Qwen2.5-VL,媲美SD3!

多模态AI发展进入新阶段,字节跳动开源通用多模态大模型BAGEL。它支持多模态输入输出与思维链推理,性能超Qwen2.5 - VL等,安装使用友好,有多种应用场景。

开源星探
推荐文章7

2025年各大厂真实面试题,抓紧上车还有机会!!!

作者小华整理 2025 年字节跳动、腾讯、阿里大厂面试真题及题解,涵盖算法、数据库、分布式等多领域,还给出记忆方法,助找工作或刷题同学备考。

小华同学ai
开源动态8

2w+ star,和claude对着干,牛皮!

Anthropic 给 Claude 生成文字添加水印,方式独特且难去除。`watermarks-remover` 项目应运而生,针对不同水印机制分层处理,兼容多格式文件,有多种安装使用方式,还明确告知能力边界。

开源先锋
算法论文8

文生Scaling新变量,被字节Seed团队发现了

ByteDance Seed团队研究发现,文生模型中自然语言Caption变长,不意味着模型获更多视觉监督,其信息量更能预测训练损失。团队提出Structured Prompt,从两侧提升文本条件,在多任务上取得显著提升。

机器之心
新闻资讯7

DoorDash 如何打造了一款不完全依赖大型语言模型(LLM)的 AI 购物助手

DoorDash 分享对话式 AI 助手 Ask DoorDash 的架构,它借助 LLM、AI 代理等构建系统。测试显示其提升了结账转化率等指标,还构建自动评估框架改进质量衡量,架构分离协调与业务功能。

InfoQ
开源动态7

别再傻傻做视频啦!!!52.1k Star Remotion,把 React 组件变成视频生产线,强到离谱~~

Remotion是用React程序化创建视频的开源项目,可把视频元素写成组件按时间线组合后渲染。它适合有批量生产需求者,不过做真人vlog等传统剪辑软件更顺手,且使用有license限制。

小华同学ai
新闻资讯7

Reddit一张神疯传!2年后,你的笔记本就能跑Fable 5

r/LocalLLaMA社区一张刷屏AI圈,显示Fable 5级AI预计2年后可在笔记本本地运行。从历史模型看,前沿能力从云端到本地约24个月。这意味着AI正从云端垄断走向桌面民主化。

新智元
产品应用7

Codex自改进Prompt:让AI自己把重复工作变成自动化

开发者Vaibhav更新的Codex自改进Prompt引发AI开发者群体讨论,被OpenAI联合创始人转发。完整版核心逻辑可拆解为8步,加了严格跳过规则。实测有反馈,也有优化建议和现存问题。

AI工程化
产品应用7

谷歌向左、李飞飞往右,阿里世界模型「快乐生蚝」杀出第三条路

阿里推出世界模型HappyOyster(快乐生蚝),基于原生多模态架构,有漫游和导演两大核心功能,可实时构建和交互。与文生视频模型不同,它能随时被干预。虽世界模型尚处早期,但应用场景广泛。

机器之心
新闻资讯7

Anthropic宣布练出神话级模型:Claude Mythos,代码和黑客能力吊打opus4.6,不向公众开放!

Anthropic宣布Project Glasswing计划,因训练出超强模型Claude Mythos Preview。该模型代码和推理能力超opus 4.6,扫描主流软件发现数千零日漏洞。此模型不向公众开放,计划先在Claude Opus验证安全机制。

AI寒武纪