Нахождение строк с самым низким значением в их третьем столбце, данном результаты grep

Question 1

У меня есть файл, который состоит из строк как это (другие включенные числа). Это - часть вывода

$ grep 1848 filename.csv

Как я могу найти лучшие 5 строк, которые имеют самый низкий третий столбец в .csv файл, учитывая, что 1848 или в первом или втором столбце?

1848,2598,11.310694021273559
1848,2599,10.947275955606203
1848,2600,10.635270124233982
1848,2601,11.916564552040725
1848,2602,12.119810736845844
1848,2603,12.406661156256154
1848,2604,10.636275056472996
1848,2605,12.549890992708612
1848,2606,9.783802450936204
1848,2607,11.253697489670264
1848,2608,12.16385432290674
1848,2609,10.30355814063016
1848,2610,12.102525596913923
1848,2611,11.636595992818505
1848,2612,10.741178028606866
1848,2613,11.352414275107423
1848,2614,12.204860161717253
1848,2615,12.959915468475387
1848,2616,11.320652192610872

К сожалению, 1848 иногда появляется в третьем столбце также, и я должен проигнорировать что:

6687,8963,9.241848677632822
6687,9111,10.537325656184889
6687,9506,11.315629894841848

Question 2

С видом GNU:

grep -E '(^1848|^[0-9]{4},1848)' file | sort -t, -k3n | head -n 5

(если первый столбец может иметь меньше или больше, чем точно 4 цифры, замените {4} +)

Вывод:

1848,2606,9.783802450936204
1848,2609,10.30355814063016
1848,2600,10.635270124233982
1848,2604,10.636275056472996
1848,2612,10.741178028606866

Question 3

Question 4

С просто awk:

awk -F, 'BEGIN{PROCINFO["sorted_in"]="@ind_num_asc"} \
          $1==1848||$2==1848 {a[$3]=$0} END {for(i in a) print a[i]}' file.csv

BEGIN{PROCINFO["sorted_in"]="@ind_num_asc"} устанавливает порядок любого массива, который будет создан согласно индексу, согласно цифрам, в возрастающем стиле
$1==1848||$2==1848 {a[$3]=$0} проверки, если первым или вторым полем является 1848, раз так затем третье поле ($3) взят в качестве массива a индекс, при этом значение является целой записью ($0)
В END {for(i in a) print a[i]}, мы - простая итерация по ключам и печать значений

Для получения только 5 записей добавить head -5 в конце:

awk ... | head -5

Только ради полноты, можно, очевидно, получить только первые 5 записей путем слияния крошечного break логика в END цикличное выполнение, никакая потребность в tail:

awk -F, 'BEGIN{PROCINFO["sorted_in"]="@ind_num_asc"} \
          $1==1848||$2==1848 {a[$3]=$0} END {j=0; for(i in a) \
           {print a[i]; j++; if(j==5) break}}' file.csv

Пример:

% cat file.txt
1848,2598,11.310694021273559
1848,2599,10.947275955606203
1848,2600,10.635270124233982
1848,2601,11.916564552040725
1848,2602,12.119810736845844
1848,2603,12.406661156256154
1848,2604,10.636275056472996
1848,2605,12.549890992708612
1848,2606,9.783802450936204
1848,2607,11.253697489670264
1848,2608,12.16385432290674
1848,2609,10.30355814063016
1848,2610,12.102525596913923
1848,2611,11.636595992818505
1848,2612,10.741178028606866
1848,2613,11.352414275107423
1848,2614,12.204860161717253
1848,2615,12.959915468475387
1848,2616,11.320652192610872

% awk -F, 'BEGIN{PROCINFO["sorted_in"]="@ind_num_asc"} $1==1848||$2==1848 {a[$3]=$0} END {for(i in a) print a[i]}' file.txt
1848,2606,9.783802450936204
1848,2609,10.30355814063016
1848,2600,10.635270124233982
1848,2604,10.636275056472996
1848,2612,10.741178028606866
1848,2599,10.947275955606203
1848,2607,11.253697489670264
1848,2598,11.310694021273559
1848,2616,11.320652192610872
1848,2613,11.352414275107423
1848,2611,11.636595992818505
1848,2601,11.916564552040725
1848,2610,12.102525596913923
1848,2602,12.119810736845844
1848,2608,12.16385432290674
1848,2614,12.204860161717253
1848,2603,12.406661156256154
1848,2605,12.549890992708612
1848,2615,12.959915468475387

% awk -F, 'BEGIN{PROCINFO["sorted_in"]="@ind_num_asc"} $1==1848||$2==1848 {a[$3]=$0} END {j=0; for(i in a) {print a[i]; j++; if(j==5) break}}' file.txt 
1848,2606,9.783802450936204
1848,2609,10.30355814063016
1848,2600,10.635270124233982
1848,2604,10.636275056472996
1848,2612,10.741178028606866

Zanna · Accepted Answer · 23 November 2019 в 08:43