多模态编程」共找到 1963 篇相关文章

8

龙虾“黑入”卡帕西家的智能家居系统:本来需要控制六个软件,现在用WhatsApp就能操控

特斯拉前AI总监卡帕西做客播客,分享诸多AI观点。如编程成个人能力问题,可让AI写代码;用龙虾打理智能家居,整合多软件;还谈及autoresearch、模型能力断层、模型分化、开源闭源格局等内容。

量子位
新闻资讯7

The Batch: 918 | 智能体 AI 引发投资者恐慌

投资者担忧AI系统动摇软件制造商商业根基,致标普软件与服务指数等大幅下挫。Anthropic推出多款产品加剧风波,后与部分公司合作使SaaS类股反弹,但未收复全部跌幅。AI正重塑软件市场,SaaS未死,正迈向AI原生化。

DeeplearningAI
产品应用8

引爆千亿市场!杭州AI再出王炸:刷新自研天花板,“三甲专家大脑”装进14亿人口袋

在2026智诊科技AI发布会上,智诊科技完成蜕变。其发布的Wise MemOS 2.0打破传统局限,WiseDiag V2有深度多模态联合分析能力,WiseResearch让AI告别幻觉,“好伴AI”下放技术,服务大众。

AI寒武纪
算法论文8

模型声称会“脑补”,结果被论文打脸了?潜在空间想象竟是“摆设”!

多模态大模型中“潜在视觉推理”概念很火,研究者让模型在潜在空间“想象”。但清华和北交学者论文指出,潜在 Token 不关心输入、不影响输出、没信息量。作者提出 CapImagine 方案,效果远超潜在空间方法。

深度学习自然语言处理
产品应用7

Nsight Python 简介

Nsight Python 是基于 NVIDIA Nsight Tools 的 Python profiling 接口,能采集 CUDA kernel 性能指标。文章介绍其环境依赖、常用 API,还给出多个示例及限制,如可与 Agent 配合,辅助写出更快的 kernel 代码。

GiantPandaLLM
产品应用7

自动化评测的九九归一——评测agent

本文提出统一评测Agent架构,实现评测全链路自动化。它能学习标注标准,完成自动标注等工作。还介绍架构、解耦方法、模型优化及训练方案,解决多模态幻觉等问题,提升机审率,节省标注成本。

阿里云开发者
开源动态8

蚂蚁开源世界模型LingBot-World:具有分钟级记忆的实时世界模拟器

蚂蚁集团旗下灵波科技开源具身智能模型及世界模型LingBot-World,它将视频生成模型进化成可交互世界模拟器,采用多阶段进化策略,有涌现记忆等能力,虽有不足,但为开源社区构建世界模型迈出坚实一步。

AIGC开放社区
新闻资讯7

AI看不懂的色盲测试背后,藏着一场像素与诗意的战争。

作者和同事测试AI色盲测试图,多模态模型Gemini 3 Pro、Claude Opus 4.5等纷纷答错,仅GPT 5.2 Thinking答对且靠代码作弊。研究发现,AI看图断章取义,缺乏人类的“格式塔”能力。

数字生命卡兹克
新闻资讯7

只会写代码没戏了!奥特曼最新面试题曝光:1人要干1个团队的活

OpenAI开年首场答疑会,奥特曼坐镇回应关切。他承认团队为追求ChatGPT编程能力,牺牲创意协作能力。还谈及软件工程未来变革、AI成本降低、Agent自主运行等问题,也对众多提问给出看法。

新智元
开源动态8

DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini

DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。

新智元