「多模态视频生成大模型」共找到 3315 篇相关文章
刚刚,OpenAI开源2个推理模型:笔记本/手机就能跑,性能接近o4-mini
OpenAI深夜开源gpt-oss-120b和gpt-oss-20b推理模型,距上次开源已6年。模型亮点多,性能强,在多方面表现超专有模型。官方还放实测视频,展示其使用效果,同时解释了开源原因。
对话AutoCoder宿文:做5000万程序员的AI IDE,不如做10亿软件消费者的Vibe Coding
2025年AI Coding赛道火热,大厂纷纷布局。AutoCoder创始人宿文认为不应与大厂卷辅助编程,要走出差异化,做面向10亿软件消费者的Vibe Coding。团队迭代代码模型,产品数据表现佳,还分享了创业、产品、市场等多方面看法。
在AI工具间来回切换了1年后,可灵用一张画布终结了它。
作者参加WAIC印象最深的是可灵更新,其首发灵动画布并升级多图参考功能。灵动画布可一站式完成图文视频创作,多图参考精准度提升,解决了AI工具孤岛化问题,让创作更自由。
AI编码不是梦:手把手教你指挥Agent开发需求
文章聚焦AI实践应用,以后端开发为例,介绍用AI编码实现需求的流程,涵盖工程结构、各层代码生成等。还分析AI编程问题,提出解决方案,给出生产案例,最后展望AI在研发中的应用前景。
百度开源文心4.5系列10款模型,多项评测结果超DeepSeek-V3
今日百度正式开源文心大模型4.5系列10款模型,涵盖不同参数规模。该系列模型在多文本和多模态基准测试达SOTA,多项评测超Qwen3、DeepSeek - V3,还具备三大关键创新,获开发者关注。
从AI Agent到Agentic AI:开源如何助力开发者解决行业痛点?
2025年全球开源软件项目数量增长,中国企业贡献显著。字节跳动在火山引擎原动力大会开源开发者日上,多位负责人分享开源经验,探讨其为AI Agent带来的技术改变,展示解决行业痛点的理念与实战经验。
揭秘大模型评测:如何用“说明书”式方法实现业务场景下的精准评估
文章系统性介绍业务场景下大模型评测流程,包括需求分析、评测集设计生成、维度设定、任务执行和报告输出。指出评测挑战,如设计维度和集,还给出评测方法及案例,像蚂蚁评测集、业务自动化评测。
AI操作有了“紧急刹车”!通义&自动化所AI决策诊断模型,GUI智能体纠错正确率SOTA
阿里通义实验室与中科院自动化所推出GUI - Critic - R1模型,能在GUI智能体操作执行前诊断决策,避免错误。介绍了其动机、方法、数据集及实验,证明该模型在生成判断和提建议方面有效。
冲击自回归,扩散模型正在改写下一代通用模型范式
Google I/O 2025 开发者大会上,Gemini Diffusion 引发关注,它是采用扩散模型的语言模型。此前已有团队探索扩散式 LLM,如斯坦福、上海 AI 实验室等。蚂蚁集团和人大推出 LLaDA,后发展出多模态模型,国内团队跻身前列。
利用大模型检测钓鱼邮件:方法,效果及数据集
随着企业安全防范增强,钓鱼邮件成重要攻击手段,大模型检测方法盛行。日本论文详细披露检测方法和实验数据,含解析解码、简化邮件、生成prompt、调用LLM四步,还介绍数据集及评估了四个模型效果。