「多模态Agent模型」共找到 9617 篇相关文章
4K超分Agent修图师来了!一键救活所有模糊照片
传统图像放大模型应对复杂情况力不从心,4KAgent应运而生。它基于多智能体设计,有感知、复原等模块,能为图像定制4K超分方案,在多领域测试中表现出色,无需特定领域再训练。
AlphaEvolve:陶哲轩背书的知识发现 Agent,AI 正进入自我进化范式
Google今年5月发布的AI系统AlphaEvolve,结合Gemini模型与evaluator,能发现新算法。它源于FunSearch,可多领域应用,运行机制类似自然进化,其关键组件evaluator对其发展很重要,也标志AI进入自我改进范式。
DataBuddy:数据语义驱动的企业 Agent Runtime 设计与落地|AICon 深圳
2026年AICon深圳站8月21 - 22日举办,聚焦多关键方向。腾讯彭锦文将分享《DataBuddy:数据语义驱动的企业Agent Runtime设计与落地》,拆解DataBuddy相关架构,还介绍演讲痛点、听众收益等,大会有10个专题论坛。
两分钟Claude Code模型换成DeepSeek,立省17倍,缓存后爆省120倍
GitHub开源deepclaude,两分钟可将Claude Code模型换成DeepSeek V4 Pro,开销直降17倍。自带上下文缓存机制,重复对话成本降120倍。支持多后端选项,可丝滑切换,还能打破设备限制远程编程。
比「小龙虾」更能打,中国AI视频大模型悄悄登顶全球第一
昆仑万维旗下 SkyReels-V4 Preview 版在权威评测平台超越 OpenAI、Google 等模型,登顶全球第一。它提升语义理解和逻辑能力,新增参考任务,还支持多语言短剧生成、视频编辑等,将在中关村论坛亮相。
OpenAI主攻速度的第一个模型来了:GPT‑5.3‑Codex‑Spark
OpenAI发布GPT-5.3-Codex-Spark,是GPT-5.3-Codex轻量级版本,也是首个为实时编程设计的模型。亮点是速度快,推理超每秒1000 token,已向ChatGPT Pro用户开放,后续规划融合两种工作模式。
没想到,音频大模型开源最彻底的,居然是小红书
近几个月,开源成AI社区焦点,国内厂商七八月开源多款大模型,但音频生成占比小。小红书技术团队自去年起在音频领域稳定开源,成果覆盖TTS、ASR方向,具商用属性,降低落地门槛。
3.6K Star 开箱即用!开源Agentic浏览器,Perplexity Comet最强平替!
传统浏览器缺乏AI自动化能力,新兴的Perplexity Comet又有云端依赖和费用高的问题。开源的Agentic浏览器BrowserOS可作其平替,有AI聊天扩展等组件,功能强大且跨平台,能带来安全智能的浏览体验。
LLM省钱大测评!48块GH200,首个百亿级参数量实证
EfficientLLM项目聚焦LLM效率,提出三轴分类法和六大指标,实验覆盖多方面。研究表明效率优化需权衡,最优策略因任务和模型规模而异,且相关技术可迁移到跨模态模型,成果将开源。
中国科学SCPMA | 南科大王建春团队:基于改进隐式轴向分解Transformer的三维槽道湍流快速预测
南科大王建春团队改进IFactFormer模型,采用“并行”轴向分解注意力机制,提升在复杂流动问题中的表征能力和稳定性。实验显示,改进模型拟合与长期预测能力强,多数指标精度优于传统方法。