「视觉 - 语言数据」共找到 3778 篇相关文章
Grok最新模型吃上Cursor「加餐」,马斯克:Coding实现巨大改进
马斯克在X上透露,xAI的Grok基础模型V9 - Medium(1.5T)完成训练,预计2 - 3周后发布,训练加入大量Cursor数据。同时,xAI的AI编程代理工具Grok Build进入早期Beta测试阶段。
多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降
多模态大推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。
港大刚刚开源了 CLI-Anything!一个命令让任意软件秒变 AI Agent 原生工具!
香港大学数据科学实验室团队开源 CLI - Anything,它以 CLI 为桥梁,将人类软件转变为 Agent 能用的工具。该项目有一键生成 CLI、真实软件集成等亮点,还给出快速入手步骤和使用示例,未来规划宏大。
字节开源GUI Agent登顶GitHub热榜,豆包手机核心技术突破26k Star
字节开源的豆包手机核心支撑GUI Agent模型UI - TARS登顶GitHub热榜,突破26k Star。它是多模态AI智能体,纯视觉驱动,部署简单,历经多轮迭代,成为热门开源多模态Agent。
AI招聘逆天研究:看照片预测一生职业成就
硅谷大厂HR标配的AI招聘系统Eightfold AI被指控算法歧视,求职者要求提高招聘筛选透明度。同时,美国多所高校研究者完成一项研究,AI能通过人脸照片预测职业走向,但因训练数据问题引发公平性争议。
DeepSeek-OCR降本增效,10×暴力压缩还能读得清
Deepseek - OCR模型发布,通过光学压缩技术解决长文本处理的计算效率问题,能控制大模型token消耗成本。介绍了其架构设计、数据引擎及训练流程,还展示其用较少token超越现有模型的能力。
马斯克开始疯狂剧透Grok 5了
ARC - AGI榜单官宣新SOTA,用Grok 4+程序合成技术微调,超越一众明星模型。马斯克剧透Grok 5,称其能达AGI,将几周内开始训练。投入大量训练数据和硬件资源,但成品效果仍待观察。
核心团队被谷歌挖角后,Cognition 宣布收购 Windsurf 剩余团队
今日凌晨,29岁华人IOI金牌创始人Scott Wu官宣Cognition AI收购Windsurf。此前谷歌以24亿美元收购其核心团队。虽部分人员出走,但Windsurf产品、业务、数据等仍具价值,Cognition计划整合技术打造生态。
奶牛版 Oura 估值 10 亿美金,AI+PDF 让它拿了 1700 万美金融资
市场上多数AI PDF产品是ChatPDF模式,用于C端。企业关键非结构化数据多在PDF等传统载体中,难以获取。硅谷工程师做的Extend AI产品,获1700万美金融资,解决传统文档处理难题,打造平台。
半年复盘,AI迎来预训练后的新瓶颈。
2025年上半年AI领域发展加速,编码和多模态能力提升。但模型在综合能力上遇到第二轮瓶颈,编码能力强时通用认知能力‘拉胯’,或与RL阶段使用编程数据有关,红杉新基准或推动模型均衡发展。