EmmyMiao87 commented on a change in pull request #974: Fix some bugs
URL: https://github.com/apache/incubator-doris/pull/974#discussion_r276972837
##########
File path:
docs/documentation/cn/administrator-guide/load-data/routine-load-manual.md
##########
@@ -94,41 +105,41 @@
`max_error_number`
用于控制错误率。在错误率过高的时候,作业会自动暂停。因为整个作业是面向数据流的,因为数据流的无边界性,我们无法像其他导入任务一样,通过一个错误比例来计算错误率。因此这里提供了一种新的计算方式,来计算数据流中的错误比例。
- 我们设定了一个采样窗口。窗口的大小为 `max_batch_rows * 10`。在一个采样窗口内,如果错误行数超过
`max_error_number`,则作业被暂定。如果没有超过,则下一个窗口重新开始计算错误行数。
+ 我们设定了一个采样窗口。窗口的大小为 `max_batch_rows * 10`。在一个采样窗口内,如果错误行数超过
`max_error_number`,则作业被暂停。如果没有超过,则下一个窗口重新开始计算错误行数。
- 我们假设 `max_error_number` 为 200000,则窗口大小为 2000000。设 `max_error_number` 为
20000,即用户预期每 2000000 行的错误行为 20000。即错误率为 1%。但是因为不是每批次任务正好消费 200000 行,所以窗口的实际范围是
[2000000, 2200000],即有 10% 的统计误差。
+ 我们假设 `max_batch_rows` 为 200000,则窗口大小为 2000000。设 `max_error_number` 为
20000,即用户预期每 2000000 行的错误行为 20000。即错误率为 1%。但是因为不是每批次任务正好消费 200000 行,所以窗口的实际范围是
[2000000, 2200000],即有 10% 的统计误差。
错误行不包括通过 where 条件过滤掉的行。但是包括没有对应的 Doris 表中的分区的行。
* data\_source\_properties
`data_source_properties` 中可以指定消费具体的 Kakfa partition。如果不指定,则默认消费所订阅的 topic
的所有 partition。
- 注意,当显示的指定了 partition,则导入作业不会再动态的检测 Kafka partition 的变化。如果没有指定,则会根据 kafka
partition 的变化,动态消费 partition。
+ 注意,当显式的指定了 partition,则导入作业不会再动态的检测 Kafka partition 的变化。如果没有指定,则会根据 kafka
partition 的变化,动态调整需要消费 partition。
Review comment:
```suggestion
注意,当显式的指定了 partition,则导入作业不会再动态的检测 Kafka partition 的变化。如果没有指定,则会根据 kafka
partition 的变化,动态调整需要消费的 partition。
```
----------------------------------------------------------------
This is an automated message from the Apache Git Service.
To respond to the message, please log on to GitHub and use the
URL above to go to the specific comment.
For queries about this service, please contact Infrastructure at:
[email protected]
With regards,
Apache Git Services
---------------------------------------------------------------------
To unsubscribe, e-mail: [email protected]
For additional commands, e-mail: [email protected]