阿里云 EMR Serverless StarRocks(Stella 2.2.0) 发布:内表与湖表同时支持向量 全文与 AI Function 一条 SQL 完成多模态检索
一、AI时代,企业需要的不是更多引擎,而是处理与分析闭环
大模型应用正在把企业数据从“结构化宽表”扩展为结构化、半结构化与非结构化数据共存。以智能驾驶为例,一条数据既包含车辆、天气、时间、传感器等结构化字段,也关联图片、语音、视频和文本描述;具身智能则需要同时管理机器人状态、任务指令、视觉轨迹、动作序列和训练标注。
传统方案往往需要计算引擎、搜索引擎、向量数据库和模型服务协同:数据被复制到多套系统,Schema与索引重复维护,结果还要在应用层拼装。随着数据规模和模态增加,链路成本、数据一致性与在线稳定性都会成为瓶颈。
Stella2.2的目标,是用一份数据和一套SQL入口完成两类核心工作:
多模态处理:通过AIFunction对文本、图片、音频、视频进行理解、抽取、分类、摘要和向量化;
多模态检索:在存算分离内表与Paimon湖表上组合结构化条件、全文与向量检索,直接服务分析、样本圈选、RAG与Agent。
二、Stella演进:从正式发布、性能领先到多模态闭环
| 版本 | 产品里程碑 |
|---|---|
| Stella1.0 | Stella正式发布,面向云上湖仓分析提供更好的性能与稳定性,并以全托管Serverless形态降低运维和弹性扩缩成本。 |
| Stella2.0 | TPC-H打榜第一,OLAP性能达到SOTA;同时补齐ETL核心能力,进入ETLProductionReady阶段。 |
| Stella2.2 | 形成多模态处理与分析闭环:AIFunction负责数据理解与向量化,存算分离内表和Paimon湖表共同承载多模态检索与分析。 |
Stella2.2不是单独增加一项搜索能力,而是把AI数据加工与数据检索放回同一个分析系统中:处理结果可进入内表,也可通过NativeWriter写入Paimon;随后直接使用结构化、全文和向量能力完成检索与分析。
三、关键特性一:多模态处理——AIFunction
Stella2.2将模型能力封装为SQLFunction,用户可以在查询、筛选、聚合和写入SQL中直接调用模型,不需要额外编排Python服务。
3.1覆盖文本理解、生成、向量化与多模态输入
理解与治理:
ai_sentiment、ai_classify、ai_extract、ai_filter、ai_redact;生成与转换:
ai_complete、ai_translate、ai_summarize、ai_fix_grammar;语义计算:
ai_similarity、ai_embed;多模态处理:
ai_complete支持文本、图片、视频、音频输入,ai_embed_multimodal支持把多模态内容映射到统一向量空间;跨行汇总:
ai_agg、ai_agg_summary支持按业务分组完成自然语言归纳。
AIFunction可以作用于存算分离内表,也可以直接处理Paimon表中的VARCHAR、VARBINARY/BLOBdescriptor或对象URL。执行侧提供模型能力路由、批处理、并发与QPS控制、Token用量统计和错误处理,为生产环境中的模型调用提供统一治理入口。
3.2数据流示例:智驾场景自动理解与标注
Paimon/内表中的路采数据├─ 结构化字段:车型、天气、时间、传感器值└─ 多模态对象:图片、视频、音频、文本描述↓AI Function├─ ai_complete / ai_extract:场景理解与结构化抽取├─ ai_classify / ai_filter:危险场景分类与语义筛选└─ ai_embed_multimodal:生成统一向量↓结构化标签 + 文本描述 + Embedding↓写入存算分离内表,或通过 Native Writer 写入 Paimon↓进入样本圈选、训练数据治理、RAG/Agent 与 BI 分析
一条SQL即可把“理解—抽取—向量化—落表”串联起来,数据处理结果与原始业务字段保持在同一套表语义中。
四、关键特性二:多模态检索——内表与Paimon两条数据链路
Stella2.2同时覆盖存算分离内表和Paimon湖表。两者面向不同的数据组织方式,但共享统一SQL入口,混合检索能力被直接编排进业务数据流,不需要把结果拉到应用层再次拼接。
4.1存算分离内表:在线分析与多模态检索一体化
存算分离内表支持向量索引在共享存储上的构建、持久化、读取和回收,支持HNSW/IVF系列索引与余弦相似度、内积、L2距离;同时可结合内表全文/倒排索引和普通SQL谓词,完成结构化、关键词和语义相似度的联合检索。
向量索引文件随LakeTablet元数据统一管理,支持异步构建、精确Vacuum跟踪,并在索引文件缺失时回退到暴力距离计算,从而兼顾性能与可用性。查询侧支持参数化向量输入与Profile指标,便于接入在线应用并持续调优。
数据流示例:具身智能轨迹检索
机器人轨迹、任务指令、视觉特征与动作标签↓写入存算分离内表结构化列 + 文本列/倒排索引 + 向量列/HNSW(IVF)↓单条 SQL 统一编排任务/时间/设备过滤 + 关键词召回 + ANN 相似轨迹召回↓Top-K 候选轨迹与原始业务字段↓训练样本选择、失败轨迹复盘、相似任务推荐与在线分析
4.2Paimon湖表:面向多模态数据湖的原生检索与读写闭环
PaimonGlobalIndex将湖表上的多路索引统一到分布式执行框架中:
向量检索:支持ANNTop-N,覆盖余弦相似度、内积和L2距离;
全文检索:支持Tantivy全文索引与
score()Top-N;结构化过滤:BTree、Bitmap索引可作为前置过滤条件;
缓存与可观测:GlobalIndex接入DataCache,提供元数据缓存、行标量缓存与Profile指标;
多模态数据承载:可读取PaimonBLOB/BLOBdescriptor,把图片、音频、视频、文档及其结构化元数据、文本描述和向量组织在同一湖表中;
Native读写:Paimon-cppNativeReader作为读取兜底路径,NativeWriter支持数据写入、固定Bucket路由与提交错误传播,形成处理结果写回湖表的闭环。
数据流示例:智驾多模态样本圈选
OSS + Paimon├─ BLOB/descriptor:图片、视频、音频、文档├─ 结构化字段:车辆、天气、时间、标注├─ 文本字段:场景描述、工单与模型生成摘要└─ 向量字段:图片/视频/文本 Embedding↓Global Index + Native Reader├─ BTree/Bitmap:结构化候选过滤├─ Tantivy/BM25:关键词与全文召回└─ ANN:跨模态语义相似召回↓SQL 中组合多路条件与 Top-N训练样本集 / 数据质量分析 / RAG / Agent↓AI Function 继续加工 → Native Writer 写回 Paimon
这条链路强调“多模态数据在湖、处理与检索在Stella”:既保留Paimon的开放湖格式与低成本存储,又避免把多模态检索拆成多套独立系统。
五、典型场景
智能驾驶:多模态训练数据圈选
按车型、天气、时段等结构化条件筛选,再组合场景描述全文召回和图片/视频向量相似度,快速定位长尾场景;AIFunction可继续完成场景分类、标签抽取与描述生成。
具身智能:轨迹理解与相似任务检索
将任务指令、环境视觉、动作序列和运行指标统一组织,检索相似轨迹并结合结构化指标定位失败原因,为训练集构建、评测和在线决策提供数据基础。
内容、电商与广告:跨模态素材打标和检索
支持文搜图、图搜图、图搜文、视频搜文等跨模态检索,并组合类目、时间、品牌、审核状态等条件,服务商品理解、素材推荐、版权审核与内容运营。
企业知识库与RAG
对文档、图片、音视频和结构化业务数据进行抽取、摘要与向量化,通过全文、向量和权限/业务条件联合检索,为RAG与Agent提供更完整的上下文。
六、产品功能发布清单
6.1湖表多模态检索
PaimonGlobalIndex支持ANN向量Top-N、TantivyFTS
score()Top-N,以及BTree/Bitmap前置过滤;支持带得分的GlobalIndex查询,ANN候选数量与搜索参数可配置,并修正不同距离度量的排序方向;
GlobalIndex接入DataCache,新增Catalog元数据缓存、行标量缓存、索引Profile指标;
支持读取PaimonBLOB与BLOBdescriptor,Paimon-cppNativeReader作为Split读取兜底路径;
PaimonNativeWriter支持写入与固定BucketShuffle,新增
paimon_bucket(),完善TIMESTAMP/TIMESTAMP_LTZ精度写入和提交失败传播;支持Paimon
TRUNCATETABLE,并优化非Metastore分区表的分区枚举开销。
6.2存算分离内表多模态检索
支持在存算分离模式下构建、写入和读取向量索引;
向量索引文件纳入LakeTablet元数据并支持精确Vacuum跟踪;
支持异步向量索引构建,并在索引文件缺失时回退到暴力距离计算;
支持余弦相似度、内积、L2距离及参数化向量查询;
可将向量检索与内表全文/倒排索引、结构化SQL谓词组合,形成统一的多路检索流程;
新增向量检索Profile指标,便于定位召回与执行性能。
6.3AIFunction
文本理解与治理:
ai_sentiment、ai_classify、ai_extract、ai_filter、ai_redact;文本生成与转换:
ai_complete、ai_translate、ai_summarize、ai_fix_grammar;语义与向量:
ai_similarity、ai_embed、ai_embed_multimodal;分组汇总:
ai_agg、ai_agg_summary;ai_complete支持文本、图片、视频、音频与多内容组合,ai_embed_multimodal支持URL、图片二进制及多内容输入;支持OpenAI-compatible与DashScopeNative能力路由,并提供微批、限流、Token统计与错误治理。
6.4功能、性能与稳定性优化
PaimonGlobalIndex:修复OR结果聚合、索引分片范围、ANN参数顺序和度量排序方向问题;
PaimonI/O:异步读取线程安全优化,元数据与数据缓存优化,减少重复远端访问;
Paimon类型兼容:完善INT96、TIMESTAMP、TIMESTAMP_LTZ与无时区时间戳处理;
Paimon写入稳定性:固定Bucket路由、提交失败透传与NativeWriter上下文统一;
Fluss:优化谓词下推、分区裁剪和分区信息复用,并支持无LakeSnapshot的Fluss-only表读取;
查询稳定性:修复Join重排列裁剪、聚合下推后空Analytic、Lambda参数ID冲突与INSERTOVERWRITE重规划问题;
系统稳定性:增加MySQL结果发送写超时、AutoVacuum事务清理防抖和按Warehouse的慢查询指标。
七、总结
Stella1.0让ServerlessStarRocks正式进入生产,Stella2.0用TPC-H第一和ETLProductionReady建立性能与工程能力,Stella2.2则进一步把数据处理、模型调用、多模态检索和分析消费连接成闭环。
对用户而言,核心价值不是增加一套专用检索系统,而是在现有湖仓数据上直接获得AIFunction与多模态检索能力:Paimon湖表适合开放、低成本的多模态数据湖,存算分离内表适合在线分析与检索,两条路径都由Stella的统一SQL、Serverless计算和可观测体系承载。
-
07.23
遗忘之海火炮情报获取攻略:遗忘之海火炮位置与解锁方法详解
-
07.23
OpenAI 总裁布罗克曼:Kimi K3 无疑相当不错 但我们仍有巨大优势
-
07.23
旭阳新材:市占率“双料冠军”却向对手赔本供货 粗放扩张埋下多重经营隐患丨IPO观察
-
07.23
Gemini 谁啊?谷歌前沿 AI 模型迟迟未发布 竞争对手群嘲
-
07.23
Codex Claude Code 的推理档位:其实就是一句提示词
-
07.23
魔兽世界破敌开路任务攻略详解
-
-
-
-
-
- NVIDIA深化与丰田汽车技术合作
- 07.23
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏