正则表达式和文本处理工具grep,egrep

正则表达式(Regular Expression)是通过一些特殊字符的排列,来表示控制或者通配的功能,用于查找,替换,删除一行或者多行文字字符串,是用在字符处理上的一项表达式,有时候我们可通过表达式来筛选出我们所需要的信息。

正则表达式分为两类:基本正则表达式(BRE)和扩展的正则表达式(ERE)

正则表达式基本上是一种“表示法”,只要工具程序支持这种表示法,那么该工具就可以用来做字符串处理,例如vim,grep,awk,sed….等

基本正则表达式的元字符:

我们这里基本正则表达式的元字符和giobbing的元字符有些相似,也有些不同.这里我们应该忘记giobbing的元字符来重新学习正则表达式的元字符,这里不能混淆!giobbing只是shell里面支持的文件名通配

字符匹配:

.:匹配任意单个字符;

[ ]:匹配指定范围的任意单个字符;

[^]:匹配指定范围之外的任意单个字符;

匹配的字符集:

[:digit:];所有的数字

[:lower:];所有的小写字母

[:upper:];所有的大写字母

[:alpha:];所有的字母

[:punct:];所有标点符号

[:space:];空白字符

[:alunm:];所有字母和数字

匹配次数

要用在指定出现次数字符的后面,用于限制其前面字符出现的次数;默认工作在贪婪模式中

*:匹配其前面的字符任意次;0次1次或者多次

例如:grep "t*b"

txxbb:匹配;t有出现一次

yxb:匹配;t有出现0次

tttttttpb :匹配;t有出现多次

abc:匹配;t有出现0次

\?:匹配其前面的字符0次或1次,即前面的字符可有可无;
\+:匹配其前面的字符1次或者多次,即前面的字符至少要出现一次;
\{m\}:匹配其前面的字符m次;
\{m,n\}:匹配其前面的字符至少m次;至多n次;

\{0,n\}:至多n次;

\{m,\}:至少m次;

位置锚定;用来控制匹配字符串的位置

^:行首锚定;用于匹配模式的最左侧;
$:行尾锚定;用于匹配模式的最右侧

两者结合就表示锚定的是空白行

^$:空白行

^[[:space:]]*$:空白行或者包含了空白行的字符

我们这里也可以使用\<PATTERN\>来匹配完整的单词

需要强调的是我们这里所指的单词是由非特殊字符组成的连续字符或字符串都称为单词

词首和词尾的锚定也可以使用另一种方式来锚定,这里要用到上面单词匹配的模式由转义符\加><或者b来表示;

\<或者\b:词首锚定;用于单词模式的左侧

\>或\b:词尾锚定;用于单词模式的右侧

分组及引用

如果我们需要匹配两个字符而且出现多次怎么办?这里我们就要用到分组

分组可以用括号括起来,但是括号在bash的命令行里面是有特殊含义的,所以我们这里需要用到转义符\

\(\):将一个或者多个字符捆绑在一起,当做一个整体

\(xy\)*ab

这里就表示xy这组符号要出现0次或者多次

分组括号里面的模式匹配到的内容还可以被引用,其内容会被正则表达式引擎自动记录到内部变量中;需要引用的话要用到\1,\2,\3,…..等等

\1:表示从模式左侧起,第一个左括号和与之匹配的右括号之间被模式匹配到的字符

\2:表示从模式左侧起,第二个左括号与之匹配的右括号之间被模式匹配到的字符

\3:…….

文本处理工具grep

在Linux里面所有的配置文件都是以纯文本格式来展现出来的,所以在Linux里面文本的处理是及其重要的,可以帮助我们更好的提高效率

Linux上有文本处理工具三剑客,他们各自都有着强大的文本处理能力

awk:文本报告生成器

sed:流编辑器,文本编辑工具

grep:文本过滤工具

今天主要讲grep(Global search REgular expression and print out line)

作用:文本搜索工具,根据用户指定的“模式”也就是过滤条件来对目标文件进行逐行匹配并打印匹配到的行

grep工具可以分为三类:

1.grep:支持基本的正则表达式

2.egrep:支持扩展的正则表达式

3.fgrep:不支持正则表达式

这前两个都可以加选项来表示转换为另外两个;(grep -E)=egrep ;(grep -F)=fgrep;(egrep -G,-F)

grep命令

grep:文本过滤工具
    grep  [OPTIONS]  PATTERN  [FILE...]
    grep  [OPTIONS]  [-e PATTERN | -f FILE]  [FILE...]
    --color=auto:对匹配到的文本着色高亮显示
    -i:igorecase,忽略字符的大小写
    -o:仅显示匹配到的字符串本身
    -v:显示不能被模式匹配到的行
    -E:支持使用扩展正则表达式元字符
    -q:--quit,静默模式,即不输出任何信息
    -A #:显示匹配到的行后#行
    -B #:显示匹配到的行前#行
    -C #:显示匹配到的行前后各#行
    gerp默认只显示匹配到的行

egrep:支持扩展的正则表达式来实现类似于grep的文本过滤工具
    egrep [OPTIONS] PATTERN [FILE...]
    -i:
    -o:
    -v:
    -q:
    -A:
    -B:
    -C:
    -g:支持基本正则表达式

fgrep:不支持正则表达式元字符
    当不需要用到正则表达式字符编写模式的时候,使用fgrep能更好

文本查看及处理工具

wc:文本统计
    wc  [OPTION]...  [FILE]...
    -l:lines;统计有多少行
    -w:words;统计有多少单词
    -c:bytes;统计有多少字节

cut:以某个字符段来切割显示文件内容
    cut OPTION... [FILE]...
    -d CHAR:以指定的字符为分隔符;
    -f FILEDS:要挑选出的字符串 
        \#:指定的单个字符;
        \#-\#:连续的多个字段;
        \#,\#:离散的多个字段;

sort:对文本进行排序并输出
    sort  [OPTION]...  [FILE]...
    -n:基于数值大小而非字符进行排序;
    -t CHAR:指定分隔符
    -k \#:用于排序比较的字段;
    -r:逆序排列;
    -f:忽略字符大小写;
    -u:重复的行只保留一份

uniq:报告或者移除重复的行
    uniq [OPTION]... [INPUT [OUTPUT]]
    -c:显示每行的重复次数
    -u:仅显示没有重复的行
    -d:仅显示重复过的行

duff:逐行进行比较文件
    diff [OPTION]... FILES

练习

新建文件lovers.txt;匹配以l开头中间有两个任意字符并以e结尾的字符串后面可以为任意长度的任意字符的行看那个匹配

        He loves his lover.
        He likes his lover.
        She likes her liker.
        She loves her liker.

grep “\(l..e\).*” lovers.txt

练习:

1、显示/etc/passwd文件中不以/bin/bash结尾的行;

grep -v "\(/bin/bash\)$" /etc/passwd

2、找出/etc/passwd文件中的两位数或三位数;

grep "\<[0-9]\{2,3\}\>" /etc/passwd

3.找出/etc/rc.d/rc.sysinit或/etc/grub2.cfg文件中,以至少一个空白字符开头,且后面非空白字符的行;

grep "^[[:space:]]\+[^[space:]]" /etc/grub2.cfg

4.找出"netstat -tan"命令的结果中以'LISTEN'后跟0、1或多个空白字符结尾的行;

netstat -tan | grep "\<LISTEN\>[[:space:]]*"

原创文章,作者:N24-执念,如若转载,请注明出处:http://www.178linux.com/64285

(0)
N24-执念N24-执念
上一篇 2016-12-20 15:03
下一篇 2016-12-20 16:55

相关推荐

  • 批量部署lxc虚拟机

    前言:lxc是一种操作系统层虚拟化(Operating system–level virtualization)技术,为Linux内核容器功能的一个用户空间接口。它将应用软件系统打包成一个软件容器(Container),内含应用软件本身的代码,以及所需要的操作系统核心和库。通过统一的命名空间和共用API来分配不同软件容器的可用硬件资源,创造出应用程…

    Linux干货 2016-03-20
  • shell中的位置参数变量

    要了解位置变量,首先要知道什么是变量?  变量就是让某一个特定的字符串来代表不固定的内容,简单理解就是用一个简单的“字眼”来替代另一个比较复杂或者容易变动的数据。 而什么又是位置变量呢?  位置变量就是bash将传递给脚本的参数,按照位置不同,保存在不同的位置变量中,以便于脚本调用这些变量。 位置参数变量: $1, $2, ……

    Linux干货 2016-08-12
  • 高级文件文件系统管理之btrfs系统

    一.概述 btrfs文件系统:     技术预览版     btrfs (B-tree,Butter FS,Better FS),GPL,Oracle,2007,CoW     ext3/ext4,xfs 核心特性:  &nbsp…

    Linux干货 2016-09-11
  • 脚本数组及yum软件包管理器

    一、数组 变量:存储单个元素的内存空间 数组:存储多个元素的连续的内存空间,相当于多个变量的集合。 数组名和索引索引:编号从0开始,属于数值索引注意:索引可支持使用自定义的格式,而不仅是数值格式,即为关联索引,bash4.0版本之后开始支持。bash的数组支持稀疏格式(索引不连续) 1.定义数组声明数组:    declare …

    Linux干货 2016-08-25
  • nmcli及网络配置

    2017-09-10
  • 计算机基础知识(第一天)

    一、计算机的硬件组成         冯诺依曼体系结构:             CPU、存储器、输入设备、输出设备       &nbsp…

    Linux干货 2016-07-26