视觉智能主要来自语言模型

Visual Intelligence Comes from Language Models

伊森·何 Ethan He · Latent Space · 2026-06-01 · 约 105 分钟 · 原视频 ↗

打开互动全文版(中英对照 + 朗读 + 问答)→

本期速览 · Overview

一位研究者认为视频模型的进步主要来自语言模型而非视频架构本身,并分享了他在 xAI 构建视频模型的经验。

A researcher argues that improvements in video models are driven by language models, not video-specific architectures, and shares his experience building video models at xAI.

要点 · TL;DR

核心观点 · Key points

反共识 · Contrarian takes

本期章节 · Chapters(共 23)

阅读全文双语转录 →