Yicong Huang created SPARK-58157:
------------------------------------

             Summary: Refactor SQL_TRANSFORM_WITH_STATE_PYTHON_ROW_UDF
                 Key: SPARK-58157
                 URL: https://issues.apache.org/jira/browse/SPARK-58157
             Project: Spark
          Issue Type: Sub-task
          Components: PySpark
    Affects Versions: 5.0.0
            Reporter: Yicong Huang


Refactor SQL_TRANSFORM_WITH_STATE_PYTHON_ROW_UDF so that the worker uses the 
plain ArrowStreamSerializer for pure Arrow stream I/O, moving the per-eval-type 
logic (regrouping rows by grouping key into Row objects and converting result 
Rows back to Arrow) from TransformWithStateInPySparkRowSerializer into 
read_udfs() in worker.py. The serializer class is kept for now since 
TransformWithStateInPySparkRowInitStateSerializer (init-state variant, tracked 
separately) still subclasses it. Part of SPARK-55388.



--
This message was sent by Atlassian Jira
(v8.20.10#820010)

---------------------------------------------------------------------
To unsubscribe, e-mail: [email protected]
For additional commands, e-mail: [email protected]

Reply via email to