「V4模型」共找到 8556 篇相关文章
深度拆解 Muse Glimmer,24GB 显存跑 30B Agent,Meta 到底做了什么?
昨天,Meta发布约30B参数的多模态Agent模型Muse Glimmer,支持128K级上下文。它采用Apache 2.0许可证开放,有量化版本等。其技术设计围绕显存、上下文管理等问题展开,在多方面做了取舍。
Copilot 创始工程师:大多数 AI 编码“就像开着法拉利去买牛奶一样”
GitHub Copilot 创始工程师 Neel Sundaresan 正构建智能编码工具 IBM Bob,已有 8 万 IBM 开发者使用。他认为多数 AI 编码像开法拉利买牛奶,Bob 会按需调度模型,他还谈及智能体市场变化与风险。
DeepSeek-OCR 2 架构创新性能暴涨 3.73%
DeepSeek-OCR 2核心技术突破集中于DeepEncoder V2架构创新与端到端优化。如视觉Tokenizer低参高效压缩Token,LLM式视觉编码器用双流注意力驱动因果建模等,还采用三级训练流水线提升效率。
ChatGPT开始预测用户年龄,NSFW内容要来了!
OpenAI于1月20日更新推出年龄预测功能,通过分析用户多方面信息判断是否为18岁以下。网友测试发现猜测较准,这或使NSFW内容限制放宽,不同模型版本情况有别,更新还改进语音和记忆功能。
破除水军机器人!北航团队发布全新对抗性框架SIAMD:用“结构信息”破译机器人伪装|IEEE TPAMI
本文介绍北航彭浩团队发表在TPAMI 2025的文章,提出对抗性框架SIAMD检测机器人。它将用户账户与消息交互组织为异质结构,用结构熵建模。实验显示,其在有效性、泛化性等方面优于基线模型。
谷歌翻译重大更新:实时翻译,全球无障碍交流摩擦苹果
Google搜索产品副总裁宣布Google翻译引入Gemini模型,翻译能力飞跃。更新含顶尖文本翻译、实时语音对话翻译(Beta版)及扩展语言练习功能,适用多平台多语言,谷歌期待用户反馈以优化体验。
GitHub热搜,腾讯黑科技炸场!PhotoMaker:10秒定制真人级头像,百万开发者已疯狂
PhotoMaker是腾讯ARC实验室联合南开大学发布的人像图像生成项目,荣膺CVPR 2024。它能秒级生成高质量人像,有高保真ID嵌入等机制,V2版升级显著,适用多场景,比同类项目优势明显。
AI竞争正酣,靠什么取胜?8个要点,一篇讲清楚
全球AI竞赛进入下半场,赛道转向‘谁更能干活’。我国有工业体系、应用场景和市场优势,取胜关键是‘通专融合’。文中提炼上海人工智能实验室周伯文长文8个要点,给出应对之策。
这款拿下 10k+ Star 的开源 LLM DevOps 平台,如何帮企业“批量孵化”AI 应用?——BISHENG 深度上手
BISHENG 是面向企业级场景的开源 LLM 应用 DevOps 平台,支持 GenAI 工作流等完整能力,已在众多头部组织落地。它围绕企业痛点搭建,有灵思 Agent、可视化工作流编排等亮点,适用于多场景。
Gemini 3来了,Software 3.0也快了
作者认为Gemini 3是目前最好的模型,编程时前端用Gemini 3,后端用Codex。无编程需求时,它也能助力信息处理。Google推出Generative UI,二者结合让我们接近Software 3.0。