ergminer.filtering
ergminer.filter_start_activities(log, activities, case_id_col='case_id', activity_col='activity_name', timestamp_col='timestamp')
Keep only cases whose first event is one of activities.
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
log
|
DataFrame
|
Event log DataFrame. |
required |
activities
|
Union[str, List[str]]
|
Activity name or list of activity names to keep. |
required |
case_id_col
|
str
|
Column name for case identifiers. |
'case_id'
|
activity_col
|
str
|
Column name for activity names. |
'activity_name'
|
timestamp_col
|
str
|
Column name for timestamps. |
'timestamp'
|
Returns:
| Type | Description |
|---|---|
DataFrame
|
Filtered DataFrame (same columns, subset of cases). |
Source code in src\ergminer\filtering.py
ergminer.filter_end_activities(log, activities, case_id_col='case_id', activity_col='activity_name', timestamp_col='timestamp')
Keep only cases whose last event is one of activities.
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
log
|
DataFrame
|
Event log DataFrame. |
required |
activities
|
Union[str, List[str]]
|
Activity name or list of activity names to keep. |
required |
case_id_col
|
str
|
Column name for case identifiers. |
'case_id'
|
activity_col
|
str
|
Column name for activity names. |
'activity_name'
|
timestamp_col
|
str
|
Column name for timestamps. |
'timestamp'
|
Returns:
| Type | Description |
|---|---|
DataFrame
|
Filtered DataFrame (same columns, subset of cases). |
Source code in src\ergminer\filtering.py
ergminer.filter_case_size(log, min_size=1, max_size=None, case_id_col='case_id')
Keep only cases whose event count is within [min_size, max_size].
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
log
|
DataFrame
|
Event log DataFrame. |
required |
min_size
|
int
|
Minimum number of events a case must have (inclusive). |
1
|
max_size
|
Optional[int]
|
Maximum number of events a case may have (inclusive). |
None
|
case_id_col
|
str
|
Column name for case identifiers. |
'case_id'
|
Returns:
| Type | Description |
|---|---|
DataFrame
|
Filtered DataFrame (same columns, subset of cases). |
Source code in src\ergminer\filtering.py
ergminer.filter_variants(log, variants, case_id_col='case_id', activity_col='activity_name', timestamp_col='timestamp')
Keep only cases whose activity sequence matches one of variants.
Each element of variants may be either a tuple of activity strings or
a '->'-joined string (e.g. 'A -> B -> C'), which is normalised
internally to a tuple.
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
log
|
DataFrame
|
Event log DataFrame. |
required |
variants
|
Union[List[Tuple[str, ...]], List[str]]
|
List of variants to keep (tuples or arrow-separated strings). |
required |
case_id_col
|
str
|
Column name for case identifiers. |
'case_id'
|
activity_col
|
str
|
Column name for activity names. |
'activity_name'
|
timestamp_col
|
str
|
Column name for timestamps. |
'timestamp'
|
Returns:
| Type | Description |
|---|---|
DataFrame
|
Filtered DataFrame (same columns, subset of cases). |