2026 年 9 月 · 流花科技正式发布 Flove——面向空间智能的原生世界模型

Flove: A World Model for Spatial Intelligence

世界模型能够生成、重建并模拟任何可能的世界。它们理解世界如何呈现、如何运转、如何演化——让我们能够为创作者渲染想象的世界、以高保真度模拟真实世界、并帮助机器人规划行动。在流花科技,我们以空间智能为目标,构建通用的世界模型。

今天,我们正式发布 Flove——新一代原生世界模型。它将二维视觉升维为带空间结构、时序连续性、可交互的三维世界,并原生支持文本、图像、视频与三维数据。Flove 为规模化而生:其性能随训练算力提升而持续增强。

WORLD GENERATION · 世界生成
从一张图像,想象整个世界
Flove 将输入锚定于三维空间,生成连贯一致的多元视角
Capabilities

一个模型,四项核心能力

Flove 能够胜任覆盖世界生成、重建与模拟的广泛任务。

相机可控生成 CAMERA-CONTROLLED

由一张或多张图像生成图像与视频,实现像素级相机控制,最高输出 1 分钟 1440p 视频。

空间重建 RECONSTRUCTION

由一到数十张输入图像重建真实场景,输出新视角图像与显式三维结果。

时空模拟 SPACE-TIME SIMULATION

对输入视频进行时空建模,实现视频重构与机器人 Real-to-Sim 工作流。

世界生成 WORLD GENERATION

基于真实场景语义生成空间一致的数字环境,扩展场景与训练数据。

01 · Camera-Controlled Generation

相机可控生成

Flove 接收一张或多张参考图像,在你指定的任意相机位置与角度生成全新视角。生成视图与输入图像的内容和几何保持一致,并平滑地外推至画面之外,想象输入中不可见的部分。

像素级相机控制

让每一个镜头尽在掌握

Flove 将精确的相机几何作为原生输入类型,超越以往基于粗粒度文本的相机控制方式。这让每一个镜头的取景、每一次运动的控制都尽在掌握。

单张输入 → 完整场景 任意相机路径 · 像素级控制
空间上下文生成

把输入锚定在三维空间

与 LLM 类似,Flove 先将输入编码为上下文,再基于上下文生成输出。但 Flove 的独特之处在于:每一张图像都被锚定在三维空间中的某个位置,从而形成空间上下文。管理这一空间上下文解锁了全新的创作控制力。

左帧 + 右帧 → 空间缝合 空间上下文 · 平滑插值
可控长视频

你坐在导演椅上,而非拉动老虎机

Flove 通过结合相机运动与空间上下文管理,让你以精确控制生成长视频。你设计每一个场景与每一个机位——你是在安排场景,而非碰运气。

1 分钟 · 1440p 手工设计相机路径 · 连贯世界
02 · Spatial Reconstruction

空间重建

Flove 从一张或多张输入图像重建真实世界空间。它无需特殊采集设备或数百个密集视角,即可忠实重建物体与场景。

多图重建

看得越多,想象得越少

当世界的某些部分在输入视角中不可见时,Flove 会凭借丰富的世界知识填补空白。但有时你并不需要想象——你可能想要真实世界的精确重建。输入更多图像,便为 Flove 提供更多上下文:它看到的越多,想象得越少。

输入:单张地面照片
Flove 生成:航拍视角
← 拖动滑块,对比「单张输入」与「Flove 重建的航拍视角」 →
多样化路径重建

同一场景,无数视角

Flove 能在同一场景中生成众多不同轨迹,为相同的输入图像带来全新视角。无论你如何更改相机路径,场景始终保持一致。

多轨迹 · 场景一致 任意更改路径 · 场景保持一致
显式三维输出

从点云到 3D 高斯泼溅

机器人、游戏、设计、视觉特效等领域的工作流往往需要显式的三维输出。Flove 原生处理二维图像帧与三维深度图,能够将世界输出为点云或 3D 高斯泼溅(Gaussian Splats)。

点云 → 高斯泼溅 端侧高分辨率渲染
03 · Space-Time Simulation

时空模拟

Flove 既理解世界的空间结构,也理解世界如何随时间演化。空间与时间能力的结合,为视觉特效、机器人等更多领域带来全新应用。

视频重构

从普通相机到「子弹时间」

Flove 将几台普通相机变成一套「子弹时间」多视角拍摄系统。仅需少至三台相机的素材,Flove 就能冻结时间并重构镜头,让你从不可能的视角观看事件。

3–5 台手机 · 子弹时间 冻结时间 · 不可能视角
机器人仿真 · Real-to-Sim

规模化的 Real-to-Sim

Flove 为机器人的导航与操作开辟了规模化 Real-to-Sim 的新路径。从几段随手拍摄的视频,Flove 即可辅助构建能够捕捉物体运动与交互的仿真。任务一经仿真,便可轻松变换:更换物体、位置、机器人运动、光照与背景。

Real-to-Sim · 可控变换 RGB + 深度数据 · 同一模型
04 · World Generation

世界生成

基于真实场景语义生成空间一致的数字环境,扩展场景与训练数据——形成不同视角 × 布局 × 外观 × 任务的规模化组合。

语义 → 空间一致环境 视角 × 布局 × 外观 × 任务
05 · Technical Details

技术细节

把空间控制置于模型核心。Flove 是一个全模态模型,旨在以单一统一架构处理众多任务与多种输入输出数据类型。

模型架构

多模态自回归扩散 Transformer

Flove 在多模态序列上运行,逐一生成序列中的每个新元素。这些架构特性共同作用,实现基于空间上下文的全新生成范式:

多模态

原生处理文本、图像、相机位姿与三维深度图;视频表示为图像序列。

自回归

在元素序列上运行,逐个生成输出,并以序列的前序部分为条件。

扩散

整流流模型,通过逐步去噪生成输出,可权衡速度与质量。

Transformer

主要由大规模矩阵乘法构成,天然适配现代硬件。

基准测试

在关键任务上超越专用模型

Flove 是一个执行众多任务的全模态世界模型。我们重点展示两项关键任务:相机条件生成与三维重建。

相机控制生成 · 人类评审偏好

MiniMax H3
25%
Gemini Omni
19%
Happy Horse
14%
FLUX 3
7%
Seedance
6%
Flove(本模型)
94%
050100

三维重建误差(越低越好)

方法平均DTUETH3DKITTINRGBD7-ScenesT&TScanNet
Flove(本模型)25.38.69.360.06.537.842.412.4
Pi3X (posed)28.711.118.760.213.339.342.415.7
π³ VGGT-Ω34.716.225.474.817.544.447.017.4
Depth Anything 336.49.711.4101.410.545.240.236.6
MapAnything39.311.923.893.311.350.855.129.0
基线均值47.718.234.8115.320.247.460.837.0

各数据集的平均绝对-相对点图误差(AbsRel ×10⁻³),越低越好。

模型扩展

性能随算力持续提升

现代 AI 的多数进展由规模化驱动。我们看到了 Flove 将持续随规模提升的有力证据:每一级新的算力都解锁了新的模型能力。

算力 ↑ · 能力解锁 ↑ 规模化定律 · 持续增强

Build with Flove

Flove 正以早期访问形式向合作伙伴开放。若你希望基于它构建应用,请在下方申请,我们会与你联系。

申请 Flove 内测资格 万物奔流 · 梦想生花 —— 我们也在招聘研究与工程人才,共同推进空间智能。
引用本文
@article{floweriver2026flove,
  author  = {流花科技团队},
  title   = {Flove: A World Model for Spatial Intelligence},
  journal = {流花科技博客},
  year    = {2026},
  note    = {https://www.floweriver.cn},
}