「视觉故事讲述」共找到 843 篇相关文章
DeepSeek开源新模型,提出上下文光学压缩:LLM的新记忆方式
DeepSeek开源OCR模型,探索用多少视觉信息让LLM理解文本。实验表明1000字文档约需100个vision tokens,压缩比10倍、准确率97%。还提出模拟人类遗忘等想法,有多种应用场景,且完全开源。
通用Agent是伪命题?昆仑万维方汉现场拆解:垂直推理才是胜负手|新智元十年峰会
在新智元十周年峰会上,昆仑万维董事长方汉分享公司转型故事与多模态AGI见解。他认为通用Agent非万能,垂类推理数据是关键,还提出AI商业落地逻辑,展示多款产品成果。
幸好图灵不是一位好棋手
本文讲述图灵因棋艺平庸常和唐纳德·米奇对弈,二人合作博弈树算法成AlphaGo核心。米奇受其影响成AI研究先驱,开发算法、程序,其对国际象棋残局的研究影响众多后来者。
2025年最戳心的纪录片:程序员的变与不变,太真实了
文章围绕《十字路口》纪录片,讲述开发者在 AI 时代的变与不变。AI 使开发权下沉,传统开发者角色被重新定义。纪录片记录开发者蜕变,展现其在行业变革中的选择,揭示技术革命中“人的价值重构”。
在OpenAI上班有多卷?离职员工爆料:7周打造Codex,每天熬到凌晨
OpenAI前员工Calvin French - Owen离职后在博客分享工作经历。他介绍了OpenAI内部沟通、晋升机制、战略调整等情况,还讲述Codex 7周开发发布过程,最后分享离职收获并建议创业者反思或加入顶级实验室。
抛弃预定义Tool,首次提出通过动态工具生成的Agentic多模态Reasoning,破31%涨幅
视觉推理任务中,传统多模态大模型依赖预定义工具,灵活性与领域适应性差。PyVision 框架首次让 MLLM 在推理中实时生成、执行并迭代 Python 工具,在多类任务中显著提升性能,实现范式跃迁。
从大模型到智能体:50+ 头部企业的 AI 进化实践
2025年AICon全球人工智能开发与应用大会6月27 - 28日在北京举办,50余家机构专家围绕AI Agent等前沿技术探讨落地实践与趋势。极客邦等企业代表分享应用布局,还有5大主题演讲、14个技术专场和50多个标杆案例。
SmolVLA: 让机器人更懂 “看听说做” 的轻量化解决方案
文章介绍轻量级开源视觉 - 语言 - 动作 (VLA) 模型 SmolVLA,专为机器人领域设计,可在消费级硬件运行。它用公开数据集训练,架构经优化,还引入异步推理堆栈,性能超部分大模型,降低研究门槛。
突破视频时长限制!Manus上架视频生成功能,网友:比Sora更好
Manus上架视频生成功能,可通过连续拼接突破时长限制。它按“拍电影”方式,根据提示词生成片段再合成故事。网友评价是新创作方式,但效果有提升空间,部分人认为比Sora好。
Anthropic CEO:人的幻觉比AI 更多!这是真的吗?
Anthropic公司CEO称AI幻觉比人类少,创业公司ColdIQ联合创始人Alex Vacca用虚构故事喂给ChatGPT、Claude和Gemini,测试它们识破谎言的能力,实验结果显示各模型表现不同,AI幻觉短期内难消失。