视觉Token」共找到 1238 篇相关文章

产品应用7

创新性自动化 AI 工具-终结者机器人

Terminator是最快的AI优先计算机操作SDK,用类似Playwright的API与Windows原生GUI应用交互,比基于视觉的方案更快更可靠,能操作后台应用。它重点支持Windows,部分支持macOS,暂不支持Linux。

GitHubStore
新闻资讯8

惊天大瓜!中东土豪发「纯血」大模型,背后底座竟是MiniMax?

沙特发布号称100%沙特血统的国家级大模型HUMAIN M3,后被发现基于中国MiniMax的M3模型。沙特用超1万亿阿拉伯语Tokens后训练,使模型在阿拉伯语赛道领先,代表中国AI出海新形态。

新智元
新闻资讯7

刚刚,OpenAI新Transformer火了!Astra架构首次曝光

OpenAI下一代Astra采用「循环深度」推理方法,思考Token减少但性能提升,不过其思考过程难监控。此前业界已对「循环Transformer」有研究,该架构适合数学编程任务,Astra实力获验证,GPT - 6或即将发布。

新智元
推荐文章7

别指望你的组织能变得 AI Native

一家公司买企业级 AI 授权全员铺开,虽 88% 员工采用,但交付速度未变,仅 10% 的人烧掉 90% 的 Token。文章指出企业 AI 采用率指标荒诞,分析企业 AI 应用现状,还给出落地推进建议。

特工宇宙
算法论文8

文生图Scaling新变量,被字节Seed团队发现了

ByteDance Seed团队研究发现,文生图模型中自然语言Caption变长,不意味着模型获更多视觉监督,其信息量更能预测训练损失。团队提出Structured Prompt,从两侧提升文本条件,在多任务上取得显著提升。

机器之心
算法论文8

多模态大模型别盲目刷题!诊断-生成-强化闭环,找准盲点 | ICML'26

多模态大模型训练常采用‘题海战术’,存在能力诊断不精准、视觉内容缺乏扩展等问题。北大和山大团队提出DPE框架,通过‘诊断-生成-强化’闭环提升模型能力,实验效果显著,还强调训练应具备诊断能力。

新智元
新闻资讯7

The Batch: 941|盲人辅助模型中的隐患

视障患者用AI评估外貌引发关注。失明记者Milagros Costabel撰文探讨用视觉语言模型作“虚拟镜子”的挑战与隐患,如AI会给出评判性反馈,心理学家担心这加剧抑郁焦虑。产品应提供客观解读。

DeeplearningAI
开源动态8

登顶全球权威榜单!浙大创业团队百卡打造开源实时世界模型,视频秒变可交互4D世界

全球科技界正豪赌「世界模型」,但主流模型多停留在「视觉生成」。中国影溯公司发布并开源世界模型 InSpatio - World,综合性能优异,以小博大登顶权威榜单,降低了物理世界数字化门槛,引发行业关注。

机器之心
产品应用8

2秒终结AI 3D不可能三角,我们和VAST首席科学家曹炎培聊了聊

速度、质量、管线可用性是AI 3D生成的不可能三角。VAST发布的Tripo P1.0首次在原生三维空间概率生成,2秒输出专业3D资产,效率提升百倍,生成结果可直接用于多场景,突破了这一困境。

机器之心
新闻资讯7

OpenAI要跳过5.3,直接迈向GPT-5.4了?

近日,一名OpenAI工程师在公开的Codex GitHub仓库中提交拉取请求,让GPT - 5.4型号出现在代码版本判断条件中,同时有用户发现它曾短暂出现在Codex应用的模型选择器里。线索被迅速修改或删除,引发诸多猜测。

机器之心