「视觉领域」共找到 2295 篇相关文章
Notion CEO Ivan Zhao:好的 AI 产品,做到 7.5 分就够了
Notion CEO Ivan Zhao 在播客采访中分享打造 AI 产品的观点。他认为 Notion 整合 SaaS 成生产力工具,数据库是核心。好产品做到 7.5 分即可,构建 AI 产品像“酿啤酒”,知识工作领域 Agent 未真正出现。
SimpAgent (ICCV2025 Highlight):上下⽂简化重塑GUI智能体,更少计算,更强性能
在多模态大模型加持下,纯视觉GUI智能体成通用操作智能体重要方向,但面临元素与历史上下文问题。哈工深和华为提出SimpAgent,从上下文简化建模入手,实现更快更强性能,工作被ICCV 2025录用。
Prompt | 人生金句炼金术师
作者分享“人生金句炼金术师”提示词,用其将平凡瞬间转化为哲理金句,如“想减肥没开始”“等红绿灯”等场景。给出不同风格卡片提示词,实测Gemini 2.5 Pro效果更好,还介绍了动态视觉图谱提示词。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
AI驱动增长,国产半导体设备加速突围
2025年全球半导体设备市场在AI拉动下增长,销售额预计达1330亿美元。中国市场领跑,国产企业加速突围。AI算力、存储芯片需求及后道封装测试成增长动力,本土企业在多领域取得进展,但也面临挑战。
4D空间智能:AI如何一步步「看懂」时空结构?一篇综述解析通往四维世界的五大层次
4D空间智能重建整合静态场景与时空变化,构建含时间维度的空间表征系统。南洋理工等高校研究者调研该领域,提出按建构深度分五层的新视角,展现AI认知从基础到高阶的进化路径。
多模态后训练反常识:长思维链SFT和RL的协同困境
华为与香港科大研究发现,多模态视觉语言模型中,长思维链SFT与RL组合难协同增益。研究引入难度分类方法构建数据集,分析各方法表现及组合策略困境,还给出实验发现与未来研究方向。
从OpenAI离职创业到估值1700亿美元,Anthropic用4年时间引硅谷巨头疯狂押注
最新消息,Claude背后公司Anthropic即将达成新一轮融资50亿美元,总估值达1700亿,不到半年估值涨近3倍。该公司由前OpenAI员工创立,获亚马逊、谷歌等投资,其模型在代码生成领域优势明显。
Altman 嘲讽 Meta 挖走的不是顶尖人才,OpenAI 高管首曝内幕:ChatGPT 如何让我们一夜“封神”
AI 领域人才抢夺激烈,Meta 招募 AI 人才触动 OpenAI。OpenAI CEO Altman 嘲讽 Meta 没挖到顶尖人才,还透露正评估薪酬。同时,OpenAI 播客揭秘 ChatGPT 幕后,包括名称由来、传播、内部辩论等,也谈到模型问题及应对。
抢先OpenAI?AIUI全新升级燃爆22亿终端,国内大厂定义智能交互
科大讯飞围绕智能交互场景,对AIUI、机器人超脑等4大平台全面升级。其AIUI以大模型为引擎,有儿童专属交互方案,还推出智能眼镜“三麦阵列”等,各平台在多领域应用成果显著。