[ 
https://issues.apache.org/jira/browse/PARQUET-2374?page=com.atlassian.jira.plugin.system.issuetabpanels:comment-tabpanel&focusedCommentId=17850686#comment-17850686
 ] 

Steve Loughran commented on PARQUET-2374:
-----------------------------------------

we have standard names in a constants file, but components can add more, and 
there are separate ".failed" counters/min/mean/max/ values for every duration 
tracked by name.

here's the result of a big bulk log delete where 117 page list requests where 
issued, 86 bulk delete calls. This is my audit log collection repo, doing a 
monthly cleanup helps me validate big bulk list and delete perfomance at a 
scale normal test runs could never do. 

{code}

2024-05-21 11:15:00,912 [shutdown-hook-0] INFO  statistics.IOStatisticsLogging 
(IOStatisticsLogging.java:logIOStatisticsAtLevel(269)) - IOStatistics: 
counters=((action_http_head_request=3)
(audit_request_execution=117)
(audit_span_creation=5)
(directories_created=1)
(files_deleted=21495)
(object_bulk_delete_request=86)
(object_continue_list_request=21)
(object_delete_objects=21495)
(object_list_request=5)
(object_metadata_request=3)
(object_multipart_list=1)
(object_put_request=1)
(object_put_request_completed=1)
(op_delete=1)
(op_get_file_status=2)
(op_glob_status=1)
(store_io_request=117));

gauges=();

minimums=((action_http_head_request.min=74)
(object_bulk_delete_request.min=869)
(object_continue_list_request.min=117)
(object_list_request.min=70)
(object_multipart_list.min=195)
(object_put_request.min=123)
(op_delete.min=95848)
(op_get_file_status.min=151)
(op_glob_status.min=746));

maximums=((action_http_head_request.max=624)
(object_bulk_delete_request.max=1568)
(object_continue_list_request.max=918)
(object_list_request.max=260)
(object_multipart_list.max=195)
(object_put_request.max=123)
(op_delete.max=95848)
(op_get_file_status.max=716)
(op_glob_status.max=746));

means=((action_http_head_request.mean=(samples=3, sum=832, mean=277.3333))
(object_bulk_delete_request.mean=(samples=86, sum=95423, mean=1109.5698))
(object_continue_list_request.mean=(samples=21, sum=9528, mean=453.7143))
(object_list_request.mean=(samples=5, sum=690, mean=138.0000))
(object_multipart_list.mean=(samples=1, sum=195, mean=195.0000))
(object_put_request.mean=(samples=1, sum=123, mean=123.0000))
(op_delete.mean=(samples=1, sum=95848, mean=95848.0000))
(op_get_file_status.mean=(samples=2, sum=867, mean=433.5000))
(op_glob_status.mean=(samples=1, sum=746, mean=746.0000)));

{code}


Note, for anyone who wants the filesystem (not stream) level iostats for abfs 
and s3a in filesystem.close() calls, you can turn this on yourself


{code}

  <property>
    <name>fs.iostatistics.logging.level</name>
    <value>info</value>
  </property>

{code}



> Add metrics support for parquet file reader
> -------------------------------------------
>
>                 Key: PARQUET-2374
>                 URL: https://issues.apache.org/jira/browse/PARQUET-2374
>             Project: Parquet
>          Issue Type: Improvement
>          Components: parquet-mr
>    Affects Versions: 1.13.1
>            Reporter: Parth Chandra
>            Assignee: Parth Chandra
>            Priority: Major
>             Fix For: 1.14.0
>
>
> ParquetFileReader is used by many engines - Hadoop, Spark among them. These 
> engines report various metrics to measure performance in different 
> environments and it is usually useful to be able to get low level metrics out 
> of the file reader and writers.
> It would be very useful to allow a simple interface to report the metrics. 
> Callers can then implement the interface to record the metrics in any 
> subsystem they choose.



--
This message was sent by Atlassian Jira
(v8.20.10#820010)

---------------------------------------------------------------------
To unsubscribe, e-mail: [email protected]
For additional commands, e-mail: [email protected]

Reply via email to