「图像到视频」共找到 3241 篇相关文章
「听觉」引导「视觉」,OmniAgent开启全模态主动感知新范式
针对端到端全模态大模型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在多基准测试中超越开闭源模型。
QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5
通义文档智能团队推出QwenLong - L1.5长文本推理专家,提供端到端长文本推理后训练“配方”,含数据合成管线、强化学习方法、智能体架构,在多基准测试成绩佳,代码已开源。
深度拆解沐曦MXMACA软件栈功能,算力自主+生态兼容,破解国产GPU落地难题
近日,刚 IPO 的沐曦股份发布 MXMACA 软件栈 3.3.0.X 版本。该软件栈可实现多语言支持、算子自动优化与跨框架平滑适配,能让现有 CUDA 项目近乎‘开箱即用’迁移,还兼容主流 AI 框架,助力国产 GPU 解决落地难题。
求稳的安全IP,安谋科技如何守正出奇?|甲子光年
12月24日,安谋科技推出新一代SPU IP——“山海” S30FP/S30P,构建覆盖芯片底层至应用层的一栈式安全防护体系,有抗物理攻击强等五大亮点,能适配不同场景安全需求,完善产品布局。
Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了
由前OpenAI CTO创办的Thinking Machines Lab推出的首款产品Tinker API有重大更新。取消候选名单面向所有用户,还可微调Kimi K2 Thinking,新增兼容OpenAI API接口,支持Qwen3 - VL视觉输入,降低模型训练门槛。
欧洲版DeepSeek发布Mistral 3系列模型,多模态端云生态,无差别商用交付给全球开发者
欧洲最强AI公司Mistral AI发布全系开源模型Mistral 3,从675B到3B参数打通智能链路,采用先进架构,与业界合作优化,以Apache 2.0协议交付全球开发者,推动开源智能发展。
62岁软件教父Martin Fowler警告:AI泡沫下,裁员潮印证行业萧条,大模型正将编程拖入“非确定性深渊”!
62岁软件教父Martin Fowler在The Pragmatic Engineer节目中谈AI对软件开发的影响。他认为当下行业萧条,AI有泡沫,编程从确定性转向非确定性带来挑战,也催生新工作流程,还强调测试、重构等的重要性。
震撼全网!3位00后夺200万大奖,卷走鹅厂顶级Offer
历经四个月,「腾讯广告算法大赛」战果揭晓,「Echoch」战队夺冠,另有两支战队杀入三甲,前十名全员获鹅厂Offer意向书。赛事揭示推荐系统正迈入「端到端生成」新纪元,各战队方案亮点多。
千问APP悄悄上线,阿里的AI超级入口也终于来了。
阿里千问APP悄悄上线,界面简约,功能增加,支持Qwen全系列最新模型。它将阿里系分散的AI触点收束到“千问”品牌,还默认开启搜索,整合多种功能,让普通用户使用体验更友好。
分析了1.8亿个岗位后,我发现应届生们好像被AI堵在了门外。
文章分析1.8亿个岗位发现,AI使应届生就业难,创意和执行类岗位受冲击大,管理层岗位相对稳定。如应届生毕业即失业,执行岗减少使学徒制传承受阻,长远看不利于文明进步。