Messages by Thread
-
[PR] perf(core): push a consumer's row limit into RangeShuffleReaderExec [datafusion-ballista]
via GitHub
-
Re: [PR] fix: avoid double-counting build_time in HashJoinExec elapsed_compute [datafusion]
via GitHub
-
[PR] Add per-aggregate accumulator phase metrics [datafusion]
via GitHub
-
[PR] chore(deps): bump bytesize from 2.4.2 to 2.7.0 [datafusion-ballista]
via GitHub
-
[PR] chore(deps): bump rustls from 0.23.42 to 0.23.43 [datafusion-ballista]
via GitHub
-
[PR] chore(deps): bump clap from 4.6.4 to 4.6.6 [datafusion-ballista]
via GitHub
-
[PR] chore(ci): bump astral-sh/setup-uv from 9.0.0 to 10.0.1 [datafusion-ballista]
via GitHub
-
[PR] chore(ci): bump taiki-e/install-action from 2.85.11 to 2.85.13 [datafusion-ballista]
via GitHub
-
[PR] chore(deps): bump http from 1.4.2 to 1.5.0 [datafusion-ballista]
via GitHub
-
[PR] chore(deps): bump futures from 0.3.33 to 0.3.34 [datafusion-ballista]
via GitHub
-
[PR] chore(deps): bump aws-config from 1.10.0 to 1.10.1 [datafusion-ballista]
via GitHub
-
Re: [I] Include `HashJoinExec` in the metrics user-guide [datafusion]
via GitHub
-
Re: [I] PostgreSQL compatibility: `SIMILAR TO` should treat `%` as a wildcard [datafusion]
via GitHub
-
[PR] fix: Streaming aggregation produces wrong result with grouping sets [datafusion]
via GitHub
-
[I] Streaming aggregation produces wrong result with grouping sets [datafusion]
via GitHub
-
[PR] Perf/19938 grouped flat array [datafusion]
via GitHub
-
[PR] docs: Add docstring examples to the unparser module [datafusion-python]
via GitHub
-
[I] Missing docstring examples in the `unparser` module [datafusion-python]
via GitHub
-
[PR] feat: decimal support for percentile_cont and median [datafusion]
via GitHub
-
[PR] Postgres: Accept generated columns with no mode keyword or VIRTUAL [datafusion-sqlparser-rs]
via GitHub
-
Re: [PR] feat(substrait): serialize correlated subqueries with OuterReference field references [datafusion]
via GitHub
-
[I] Q10 SF1000 regression after #2315: SortPreservingMergeExec exhausts fair memory pool under AQE default-on [datafusion-ballista]
via GitHub
-
[I] Report native child-operator spill metrics in Spark task metrics for unified shuffle plans [datafusion-comet]
via GitHub
-
Re: [PR] build(deps): bump astral-sh/setup-uv from 8.2.0 to 9.0.0 [datafusion-python]
via GitHub
-
[PR] build(deps): bump astral-sh/setup-uv from 8.2.0 to 10.0.0 [datafusion-python]
via GitHub
-
[PR] build(deps): bump github/codeql-action/analyze from 4.36.2 to 4.37.7 [datafusion-python]
via GitHub
-
[PR] build(deps): bump github/codeql-action/init from 4.36.2 to 4.37.7 [datafusion-python]
via GitHub
-
[PR] perf: cache dictionary arc pointer [datafusion]
via GitHub
-
[I] Allow a stage to start on partially complete inputs instead of waiting for the whole upstream stage [datafusion-ballista]
via GitHub
-
[I] Buffer shuffle output in memory and spill to disk only when a configured budget is exceeded [datafusion-ballista]
via GitHub
-
[I] Shuffle affinity: prototype a task distribution policy that places consumer tasks where their input already lives [datafusion-ballista]
via GitHub
-
[PR] Apply same sparse routing for range partition dynamic filter as hash partition and restructure `build_filter` [datafusion]
via GitHub
-
[PR] introduce new dictionary benchmarks [datafusion]
via GitHub
-
[PR] test: add explode operator microbenchmark [datafusion-comet]
via GitHub
-
[PR] perf(core): keep small sort-shuffle output in memory instead of on disk [datafusion-ballista]
via GitHub
-
[I] Improve search engine / agent discoverability for DataFusion website [datafusion]
via GitHub
-
Re: [PR] fix: preserve precision in log() with mixed-width float arguments [datafusion]
via GitHub
-
Re: [I] Optimize hash operations and byte-wise row comparisons for dictionary encoding [datafusion]
via GitHub
-
Re: [PR] Optimize Dictionary groupings [datafusion]
via GitHub
-
[PR] Add microbenchmark results (run on m7i.2xlarge) [datafusion-comet]
via GitHub
-
[PR] fix: remap SortMergeJoin filter during projection pushdown [datafusion]
via GitHub
-
[PR] perf(core): write one sort-shuffle file per task instead of one per input [datafusion-ballista]
via GitHub
-
[I] `SortMergeJoin` projection pushdown can reuse stale JoinFilter indices [datafusion]
via GitHub
-
[D] Policy on uptick of LLM PRs from new contributors [datafusion]
via GitHub
-
Re: [PR] feat: add metrics tracking for file sinks and update orchestration fo… [datafusion]
via GitHub
-
[PR] [NOT READY FOR REVIEW] Add DataFusion 55.0.0 release blog post [datafusion-site]
via GitHub
-
[PR] fix: reject Parquet files with duplicate column names instead of silently dropping data [datafusion]
via GitHub
-
[PR] fix: repair AQE plan rewrites and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: Enadaptive query planning by default, AQE / TPC-DS fixes [datafusion-ballista]
via GitHub
-
Re: [PR] fix: Enadaptive query planning by default, AQE / TPC-DS fixes [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
Re: [PR] fix: repair AQE plan rewrites, remove a redundant shuffle, and enable adaptive query planning by default [datafusion-ballista]
via GitHub
-
[PR] fix: preserve approximate percentile arguments with inline ORDER BY [datafusion]
via GitHub
-
[I] Add PartialReduce operator [datafusion-ballista]
via GitHub
-
[I] Inline ORDER BY drops arguments for approximate percentile aggregates [datafusion]
via GitHub
-
[PR] fix(spark): derive pmod's decimal result type from the declared arguments [datafusion]
via GitHub
-
[PR] perf(core): raise the partial-aggregation skip ratio to 0.95 [datafusion-ballista]
via GitHub
-
[PR] chore: group uv dependency updates [datafusion]
via GitHub
-
Re: [PR] chore(deps): bump pyjwt from 2.12.0 to 2.13.0 [datafusion-sandbox]
via GitHub
-
Re: [PR] feat: Add bias for`RightSemi`, `RightAnti`, `RightMark` join orientation [datafusion]
via GitHub
-
Re: [I] [Bug] mod returns NaN instead of raising for a zero floating point divisor in ANSI mode, and ignores -0.0 divisors [datafusion]
via GitHub
-
Re: [I] Union the required leaves when a nested root is reached by multiple casts (or a cast plus `get_field`) instead of reading the whole column [datafusion]
via GitHub
-
[PR] fix: roll back DiskManager usage when spill write I/O fails [datafusion]
via GitHub
-
[PR] fix: rebase lambda params after projection schema changes [datafusion]
via GitHub
-
[PR] fix: skip WindowTopN rewrite when fetch is 0 to avoid PartitionedTopK panic [datafusion]
via GitHub
-
Re: [PR] feat: build gate + inert wiring for contrib Delta scans [Delta contrib split, part 2] [datafusion-comet]
via GitHub
-
[I] enable_window_topn panics on WHERE rn < 1 (PartitionedTopK requires k > 0) [datafusion]
via GitHub
-
[PR] ci: run extended tests on aggregate and window function changes [datafusion]
via GitHub
-
[PR] perf: specialize CASE WHEN for divide-by-zero protection [datafusion]
via GitHub
-
[I] Make native contrib scan dispatch generic (remove per-contrib arms from core Rust) [datafusion-comet]
via GitHub
-
[I] Move contrib scan proto messages out of core operator.proto into contrib/<name>/proto [datafusion-comet]
via GitHub
-
Re: [I] [BUG] Error when adding Date32 and Int64 [datafusion]
via GitHub
-
Re: [I] Potential optimization for CASE WHEN for protecting against divide by zero [datafusion]
via GitHub
-
Re: [I] [datafusion-spark] Optimize hex function [datafusion]
via GitHub
-
[PR] Support native scans with unprojected Spark 4 VARIANT columns [datafusion-comet]
via GitHub
-
[PR] perf(core): zero-copy block receive on the remote fetch path [datafusion-ballista]
via GitHub
-
[PR] chore: bump rust-version to 1.97.1 [datafusion-ballista]
via GitHub
-
[PR] minor: validate config `default_null_ordering` when setting it [datafusion]
via GitHub
-
[PR] fix: canonicalize NaN in flat arrays_overlap float keys [datafusion-comet]
via GitHub
-
Re: [I] The config values aren't checked [datafusion]
via GitHub
-
[PR] fix(scheduler): drop an executor's cached gRPC client when it is removed [datafusion-ballista]
via GitHub
-
[PR] test: report expression cost against a scan-and-transfer baseline [datafusion-comet]
via GitHub
-
[PR] feat: add micro benchmark runner and EC2 guide [datafusion-comet]
via GitHub
-
[PR] fix: log(0.0::float8) should error, not return -inf [datafusion]
via GitHub
-
Re: [I] PostgreSQL compatibility: `log(0.0::float8)` should error, not return `-inf` [datafusion]
via GitHub
-
Re: [PR] build(deps): bump async-trait from 0.1.89 to 0.1.92 [datafusion-python]
via GitHub
-
[PR] Claude/shuffle code improvements [datafusion-ballista]
via GitHub
-
[I] Use end to end microbenchmarks to prevent performance regressions between releases [datafusion-comet]
via GitHub
-
[I] Nine expression benchmark rows labelled "Comet" are measuring Spark [datafusion-comet]
via GitHub
-
[PR] test: make expression benchmark harness fair and reproducible [datafusion-comet]
via GitHub
-
Re: [PR] perf: remove per-row String allocation from Spark soundex and quote [datafusion]
via GitHub
-
[PR] fix: report native shuffle write metrics accurately [datafusion-comet]
via GitHub
-
[PR] fix: preserve Catalyst nullability and field IDs in native Parquet writes [datafusion-comet]
via GitHub
-
Re: [PR] perf: Coalesce broadcast exchange batches before broadcasting [datafusion-comet]
via GitHub
-
Re: [PR] docs: add an agent skill for auditing datafusion-spark expressions [datafusion]
via GitHub
-
[PR] minor: Add alias of some SQL types (string, binary, uint64) [datafusion]
via GitHub
-
[PR] feat: Add support for Map type in SQL [datafusion]
via GitHub
-
[I] Add support for `Map` type in SQL [datafusion]
via GitHub
-
[PR] docs: explain why Ballista uses a blocking shuffle [datafusion-ballista]
via GitHub