pyspark 滞后函数(基于列)

标签 pyspark

我想实现以下目标

lag(column1,datediff(column2,column3)).over(window)

偏移量是动态的。我也尝试过使用UDF,但它没有用。

对于如何实现上述任何想法?

最佳答案

lag 函数的参数 count 采用整数而不是列对象:

psf.lag(col, count=1, default=None)

因此它不能是“动态”值。 相反,您可以在列中构建滞后,然后将表与自身连接。

首先让我们创建我们的数据框:

df = spark.createDataFrame(
    sc.parallelize(
        [[1, "2011-01-01"], [1, "2012-01-01"], [2, "2013-01-01"], [1, "2014-01-01"]]
    ), 
    ["int", "date"]
)

我们要枚举行:

from pyspark.sql import Window
import pyspark.sql.functions as psf
df = df.withColumn(
    "id", 
    psf.monotonically_increasing_id()
)
w = Window.orderBy("id")
df = df.withColumn("rn", psf.row_number().over(w))
    +---+----------+-----------+---+
    |int|      date|         id| rn|
    +---+----------+-----------+---+
    |  1|2011-01-01|17179869184|  1|
    |  1|2012-01-01|42949672960|  2|
    |  2|2013-01-01|68719476736|  3|
    |  1|2014-01-01|94489280512|  4|
    +---+----------+-----------+---+

现在构建滞后:

df1 = df.select(
    "int", 
    df.date.alias("date1"), 
    (df.rn - df.int).alias("rn")
)
df2 = df.select(
    df.date.alias("date2"), 
    'rn'
)

最后我们可以加入它们并计算日期差:

df1.join(df2, "rn", "inner").withColumn(
    "date_diff", 
    psf.datediff("date1", "date2")
).drop("rn")

    +---+----------+----------+---------+
    |int|     date1|     date2|date_diff|
    +---+----------+----------+---------+
    |  1|2012-01-01|2011-01-01|      365|
    |  2|2013-01-01|2011-01-01|      731|
    |  1|2014-01-01|2013-01-01|      365|
    +---+----------+----------+---------+

关于pyspark 滞后函数(基于列),我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/45961164/

相关文章:

python - 如何将三个 RDD 连接到一个元组中?

python - spark 谓词下推是否适用于 JDBC?

Python Pyspark 脚本在整个数据集上失败,但在单个文件上有效

csv - 从 URL 加载 PySpark

apache-spark - weekofyear() 返回 1 月 1 日看似不正确的结果

pyspark - 在 pyspark 中创建一个在第一行之后引用自身的列

python - 如何在pyspark脚本中访问SparkContext

python - Spark中的reduceByKey用于添加元组

pyspark - 如何在pyspark中使用split

python - 在 ipdb-fashion 中调试 pyspark