Hasty Briefsbeta

双语

Apache Spark 4.2: Making Your Data AI‑Developer Friendly

5 hours ago
  • Apache Spark 4.2 引入了度量视图(Metric Views),这是一个语义层,用于在仪表盘和AI系统中实现一致的业务指标。
  • 原生向量相似性函数和NEAREST BY运算符支持在Spark SQL中进行嵌入存储和相似性查询,减少了RAG和语义搜索对外部向量数据库的依赖。
  • 地理空间支持现在成为一等公民,提供了GEOMETRY/GEOGRAPHY类型和ST_*函数,简化了位置感知AI用例。
  • PySpark增强功能包括默认使用Arrow优化的UDF、现代pandas互操作性以及用于Python中毫秒级流处理的实时模式(Real-Time Mode)。
  • 自动变更数据捕获(Auto CDC)和CHANGES子句简化了增量数据管道,提高了训练集的新鲜度和可靠性。