「Mistral 3系列模型」共找到 7854 篇相关文章
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。
谷歌放的这波免费AI额度,大到很多人以为是假的
谷歌在Google AI Studio上调整Gemini API免费层规则,额度达每分钟100万token,无额外申请门槛。覆盖Gemini 2.5全系列模型,支持多模态输入。开发者反应两极,有人看好,也有人质疑。
0产品获苏妈投资!前腾讯AI大牛刘威视频创业,又融了8000万美元
前腾讯AI大牛刘威的AI视频初创公司Video Rebirth完成8000万美元融资,由AMD Ventures等联合投资。资金用于Bach系列模型商业化与全球扩张,其业务面向海外企业和专业个人用户。
DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危
据爆料,DeepSeek计划在2月中旬春节前后发布V4模型,剑指编程王座。其在编程能力、超长上下文代码处理、算法提升、推理能力上有突破,或延续高性价比路线,在受限硬件下靠算法取胜。
林俊旸Agent创业首次亮相,腾讯已投
前Qwen一号位林俊旸官宣创业公司Pragmatik Labs,方向为做横跨数字与物理世界的下一代Agent。公司获高榕、红杉、腾讯等投资,投后估值达20亿美元。虽无产品模型,但凭借林俊旸过往成绩受关注。
谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草
大模型时代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景。
阿里的 AI IDE 登场了,这事绝对有戏
阿里云正式发布通义灵码的AI原生IDE:Lingma IDE,免费开放,核心功能和Cursor对齐且速度更快。其整合Qwen、DeepSeek系列模型,有感知引擎等亮点,还有企业版适合国内公司。AI编程竞争激烈,阿里有机会做成。
历史首次!o3找到Linux内核零日漏洞,12000行代码看100遍揪出,无需调用任何工具
OpenAI总裁转发成果,o3模型找到Linux内核SMB实现远程零日漏洞,未用复杂工具。研究员实验对比o3、Claude 3.7和3.5,o3表现佳,还能找到新漏洞、给出完善修复方案。
单向VLM变双向!人大斯坦福等提出MoCa框架:双向多模态编码器
人大、斯坦福等机构提出MoCa框架,将单向视觉语言模型转化为双向多模态嵌入模型。它通过持续预训练和异构对比微调,解决传统模型局限,在多模态基准测试中表现优异,尤其小规模模型性能突出。
云计算一哥10分钟发了25个新品!Kimi和MiniMax首次上桌
亚马逊云科技CEO在re:Invent 2025上10分钟发25个新品,2小时近40个。围绕AI Agent,从算力到模型、平台、应用全面布局,还引入中国Kimi和MiniMax,构建全栈壁垒,助力企业用好AI。