「信息交互方式」共找到 1926 篇相关文章
再见,程序员!马斯克宣判:奇点就在2026
马斯克断言2026年是奇点之年,起因是Claude Code强大的编程能力引发关注。Claude Opus 4.5表现优异,碾压其他模型。奇点来临,人们工作方式将改变,AI或使软件开发自动化。
中国AI Agent产业化参考范本:斑马口语攻克的四大技术难关
2025年AI产业转折,通用大模型落地难,垂直场景成关键。斑马口语作为垂直落地的AI Agent,突破实时交互、语音识别、内容适龄、多模态呈现四大技术难关,为中国AI Agent产业化提供范本。
李飞飞3D世界模型公测,网友已经玩疯了
今日李飞飞创立的World Lab推出全新3D世界生成模型Marble并开启公测。普通人能靠文本等生成专属3D世界,还能在VR体验。它功能强大,未来将重点发力交互性。
大模型智能体如何突破规模化应用瓶颈,核心在于Agentic ROI
上海交通大学联合中科大研究指出,大模型智能体规模化应用有瓶颈,核心在于Agentic ROI 未达实用门槛。研究提出其发展呈「之字形」,先规模提升信息质量,再轻量化降成本。
OpenAI:GPT-5就是All in One,集成各种产品
OpenAI研究副总裁剧透GPT - 5将整合Codex、Operator等产品。团队分享Codex详情与未来计划,回应10大问题,如语言选择、运行方式等,还将推免费API积分,发布了Codex上手指南。
SeePhys Pro:重新审视多模态物理推理中的视觉理解与训练收益
来自中山大学等的研究者提出SeePhys Pro,是面向多模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。
DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude
DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。
2026!开年关键词:Self-Distillation,大模型真正走向「持续学习」
2026 年刚开始,大模型领域研究者达成默契,arXiv 论文高频出现 Self-Distillation。传统强教师依赖范式难适配模型持续进化,Self-Distillation 成破局点。MIT 等机构发布三项研究成果,均用信息差实现模型自驱动升级。
打破幻觉!Qwen最新OCR让印章、表格、公式识别准确率飙升45%
基于推理增强框架的视觉语言模型处理OCR任务有成果,但存在生成幻觉问题,特定领域不如专家模型。DianJin - OCR - R1通过推理与工具交互,按‘思考 - 调用工具 - 重新思考’流程提升OCR性能,减少幻觉。
不只是聊天:Gemini Agent Mode 深度集成 Android Studio,可直接修改项目
谷歌为 Android Studio 推出集成 Gemini 的 Agent Mode,在最新预览版上线。它以整个项目为上下文,能直接修改项目、执行多步骤任务,可通过 MCP 与外部工具交互,但预览版有不足,谷歌正解决。