「GPT - 5.4」共找到 3192 篇相关文章
数据智能体全景报告发布!你的数据智能体在哪个 Level?
大语言模型爆发让「数据智能体」应运而生,但概念笼统成发展绊脚石。由多顶尖机构组成的联合团队发布论文,首提 L0 - L5 六级自主性分级标准,还对现有研究回顾审视,指明挑战并描绘未来图景。
中国模型打服硅谷:Airbnb联创CEO感叹又快又好又便宜!把ChatGPT合作都拒了
当OpenAI为ChatGPT造势时,中国模型凭实力圈粉老外。爱彼迎CEO称依赖阿里Qwen,因其又好又快又便宜;Kimi K2性能碾压闭源模型;DeepSeek创新成果获多方称赞,中国模型在全球AI竞赛中走出独特路径。
只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型。
近期OCR赛道火热,作者应读者要求解读PaddleOCR-VL。它是百度PaddleOCR系列新模型,仅0.9B参数,在OmniDocBench v1.5评测多项领先。其架构高效,实测处理各类文档能力强,已开源。
Jina官方MCP三板斧:搜、读、筛
Jina官方发布MCP服务器,将核心能力封装成LLM工具集。介绍工具功能、连接使用方法,给出问题排查方案,通过案例展示搭建工作流效果,评估不同模型,指出Agent瓶颈及MCP开放生态价值。
Nano Banana 邪修之王最强科研成果!教你自定义生图比例!
Nano Banana 出图有分辨率低和比例不可控问题。作者发现用垫图方式可控制其生图比例,已生成图片也适用,还给出操作方法、提示词,介绍不同平台效果及案例图下载方式。
社区供稿 | VibeVoice实现90分钟、多角色播客生成,拓展语音合成新边界
微软亚洲研究院提出全新语音生成模型 VibeVoice,采用 next - token diffusion 机制,能将文字脚本转为最长 90 分钟、最多 4 人对话的高质量播客音频,在多方面有显著优势,未来潜力大。
BLIP3-o统一图像生成与理解,多模态融合趋势显现
BLIP3 - o致力于统一图像理解和生成,提升生成质量与效率。它融合自回归和扩散模型,采用CLIP + Flow Matching架构等。经训练,在图像理解和生成任务表现佳,指令微调效果显著。
Claude Code发布4个月,用户已经11.5万了,开发者:200 美元/月不算贵
Anthropic的Claude Code发布4个月吸引11.5万开发者,一周处理1.95亿行代码。它集成Claude Opus 4模型,功能实用,口碑好,让开发者觉得物有所值,反映开发者对AI编程工具接受度提升。
ICCV 2025|降低扩散模型中的时空冗余,上交大EEdit实现免训练图像编辑加速
上海交通大学EPIC Lab团队提出EEdit框架,入选ICCV 2025。它是首个加速匹配流模型图像编辑框架,能兼容多种引导方案,免训练,速度较原始工作流快2.4倍,支持多类型编辑任务。
刚刚,苹果绝密计划曝光!3年7款新品,AI眼镜27年卖爆千万台
知名分析师郭明錤爆料,苹果正秘密研发7款头显,2025年M5版Vision Pro打头阵,2027年智能眼镜将席卷市场,1000万台出货量可期。苹果硬件实力强,但AI软件是瓶颈。