9.4. 字符串函数和操作符 #
本节描述用于检查和操作字符串值的函数和操作符。这里的字符串包括 character、character varying 和 text 类型的值。除非另有说明,这些函数和操作符都声明为接受并返回 text 类型。它们也可互换地接受 character varying 参数。在应用函数或操作符之前,character 类型的值会先转换为 text,因此会去除 character 值的尾随空格。
SQL 定义了一些使用关键字而不是逗号来分隔参数的字符串函数。详情请见表 9.9。PostgreSQL 也提供了这些函数使用常规函数调用语法的版本(参阅表 9.10)。
注意
字符串串接操作符(||)将接受非字符串输入,只要至少一个输入是一种字符串类型,如表 9.9 所示。对于其他情况,可以添加到 text 的显式强制转换,以接受非字符串输入。
表 9.9. SQL 字符串函数和操作符
函数/操作符 描述 示例 |
|---|
|
串接两个字符串。
|
将非字符串输入转换为文本,然后将两个字符串串接起来。(非字符串输入不能是数组类型,因为那样会与数组的
|
从
|
检查字符串是否处于指定的 Unicode 规范化形式中。可选的
|
|
返回字符串中的位数(8 倍于
|
返回字符串中的字符数。
|
|
根据数据库的区域设置规则,将字符串转换为全部小写。
|
在
|
从
|
将字符串转换为指定的 Unicode 规范化形式。可选的
|
返回字符串的字节数。
|
返回字符串中的字节数。由于此版本的函数直接接受
|
用
|
返回
|
在
|
从
|
提取
|
提取匹配 POSIX 正则表达式的第一个子字符串;参见第 9.7.3 节。
|
提取匹配 SQL 正则表达式的第一个子字符串;参见第 9.7.2 节。第一种形式自 SQL:2003 起由标准规定;第二种形式只出现在 SQL:1999 中,应视为已过时。
|
从
|
这是一个非标准的
|
如果字符串中的所有字符都是已分配的 Unicode 码点,则返回 |
|
根据数据库的区域设置规则,将字符串转换为全部大写。
|
还有其他字符串操作函数和操作符,列在表 9.10 中。(其中一些用于内部实现表 9.9 中列出的 SQL 标准字符串函数。)此外,第 9.7 节中还描述了模式匹配操作符,第 12 章中则描述了全文检索操作符。
表 9.10. 其他字符串函数和操作符
函数/操作符 描述 示例 |
|---|
|
如果第一个字符串以第二个字符串开头,则返回 true(等同于
|
|
返回参数的第一个字符的数字代码。在 UTF8 编码中,返回该字符的 Unicode 码点。在其他多字节编码中,该参数必须是一个 ASCII 字符。
|
|
返回给定代码的字符。在 UTF8 编码中该参数被视作一个 Unicode 码点。在其他多字节编码中该参数必须指定一个 ASCII 字符。
|
串接所有参数的文本表示。NULL 参数被忽略。
|
用分隔符串接除第一个参数外的所有参数。第一个参数用作分隔符字符串,不应为 NULL。其他 NULL 参数将被忽略。
|
根据格式字符串对参数进行格式化;参见第 9.4.1 节。这个函数类似于 C 函数
|
|
将每个单词的第一个字母转换为大写,其余字母转换为小写。单词是由非字母数字字符分隔的字母数字字符序列。
|
返回字符串最左侧的
|
|
返回字符串中的字符数。
|
|
计算参数的 MD5 hash,结果以十六进制形式写入。
|
将
|
|
返回当前客户端编码名称。
|
|
为给定字符串添加适当的引号并返回,使其可用作 SQL 语句字符串中的标识符。仅在必要时(即字符串包含不能用于标识符的字符,或会发生大小写折叠时)添加引号。内嵌的引号会被适当地双写。另见例 41.1。
|
|
为给定字符串添加适当的引号并返回,使其可用作 SQL 语句字符串中的字符串字面量。内嵌的单引号和反斜杠会被适当地双写。注意,
|
将给定值转换为文本,然后作为字面量加引号。内嵌的单引号和反斜杠会被适当地双写。
|
为给定字符串添加适当的引号并返回,使其可用作 SQL 语句字符串中的字符串字面量;如果参数为 null,则返回
|
将给定值转换为文本,然后作为字面量加引号;如果参数为 null,则返回
|
返回 POSIX 正则表达式
|
返回 POSIX 正则表达式
|
检查 POSIX 正则表达式
|
返回 POSIX 正则表达式
|
返回 POSIX 正则表达式
{bar}
{baz}
|
替换第一个与 POSIX 正则表达式
|
替换第
|
使用 POSIX 正则表达式作为分隔符拆分
|
使用 POSIX 正则表达式作为分隔符拆分
hello world
|
返回
|
按
|
将
|
|
颠倒字符串中字符的顺序。
|
返回字符串中的最后
|
在出现
|
如果
|
将
|
在出现
xx NULL zz
|
返回
|
提取
|
将
|
|
将数字转换为等价的二进制补码表示。
|
|
将数字转换为等价的十六进制补码表示。
|
|
将数字转换为等价的八进制补码表示。
|
将
|
|
解析参数中转义的 Unicode 字符。Unicode 字符可以被指定为 如果服务器编码不是 UTF-8,由这些转义序列之一标识的 Unicode 码点将被转换为实际的服务器编码;如果无法转换,则会报告错误。 此函数提供了带 Unicode 转义的字符串常量的另一种(非标准)写法(参见第 4.1.2.3 节)。
|
concat、concat_ws 和 format 是可变参数函数,因此可以把要串接或格式化的值作为一个标记了 VARIADIC 关键字的数组进行传递(见第 36.5.6 节)。数组的元素被当作函数的独立普通参数一样处理。如果可变参数数组为 NULL,concat 和 concat_ws 返回 NULL,但 format 把 NULL 当作一个零元素数组。
还可以参阅第 9.21 节中的聚合函数 string_agg,以及表 9.13 中的字符串和 bytea 类型之间转换的函数。
9.4.1. format #
函数 format 根据一个格式字符串产生格式化的输出,其形式类似于 C 函数 sprintf。
format(formatstrtext[,formatarg"any"[, ...] ])
formatstr 是指定结果格式的字符串。格式字符串中的文本会直接复制到结果中,但格式说明符所在的位置除外。格式说明符充当字符串中的占位符,定义如何格式化后续函数参数并将其插入结果。每个 formatarg 参数都按照其数据类型通常的输出规则转换为文本,再根据格式说明符进行格式化并插入结果字符串。
格式说明符以% 字符开头,格式如下:
%[position][flags][width]type
其中各组成字段为:
position(可选)#一个形式为
的字符串,其中n$n是要打印的参数的索引。索引 1 表示formatstr之后的第一个参数。如果position被省略,默认会使用序列中的下一个参数。flags(可选)#用于控制格式说明符输出格式的附加选项。目前唯一支持的标志是减号(
-),它使格式说明符的输出左对齐。只有同时指定了width字段时,它才有效。width(可选)#指定用于显示格式说明符输出的最小字符数。输出将在左部或右部(取决于
-标志)用空格填充,以达到该宽度。太小的宽度设置不会导致输出被截断,但是会被简单地忽略。宽度可以使用下列形式之一指定:一个正整数;一个星号(*)表示使用下一个函数参数作为宽度;或者一个形式为*的字符串表示使用第n$n个函数参数作为宽度。如果宽度来自一个函数参数,会先使用该宽度参数,再使用作为格式说明符值的参数。如果宽度参数为负数,结果会在长度为
abs(width) 的字段中左对齐(如同指定了-标志)。type(必需)#格式转换的类型,用于产生格式说明符的输出。支持下面的类型:
s将参数值格式化为一个简单字符串。空值会被视为空字符串。I将参数值视作 SQL 标识符,并在必要时用双引号包围它。如果参数为 null,则会报错(等效于quote_ident)。L将参数值作为 SQL 字面量加引号。null 值显示为不带引号的字符串NULL(等效于quote_nullable)。
除了以上所述的格式说明符之外,要输出一个字面形式的% 字符,可以使用特殊序列%%。
下面是一些基本格式转换的示例:
SELECT format('Hello %s', 'World');
结果:Hello World
SELECT format('Testing %s, %s, %s, %%', 'one', 'two', 'three');
结果:Testing one, two, three, %
SELECT format('INSERT INTO %I VALUES(%L)', 'Foo bar', E'O\'Reilly');
结果:INSERT INTO "Foo bar" VALUES('O''Reilly')
SELECT format('INSERT INTO %I VALUES(%L)', 'locations', 'C:\Program Files');
结果:INSERT INTO locations VALUES('C:\Program Files')
下面是使用 width 字段和-标志的示例:
SELECT format('|%10s|', 'foo');
结果:| foo|
SELECT format('|%-10s|', 'foo');
结果:|foo |
SELECT format('|%*s|', 10, 'foo');
结果:| foo|
SELECT format('|%*s|', -10, 'foo');
结果:|foo |
SELECT format('|%-*s|', 10, 'foo');
结果:|foo |
SELECT format('|%-*s|', -10, 'foo');
结果:|foo |
这些示例展示了如何使用 position 字段:
SELECT format('Testing %3$s, %2$s, %1$s', 'one', 'two', 'three');
结果:Testing three, two, one
SELECT format('|%*2$s|', 'foo', 10, 'bar');
结果:| bar|
SELECT format('|%1$*2$s|', 'foo', 10, 'bar');
结果:| foo|
不同于标准 C 函数 sprintf,PostgreSQL 的 format 函数允许在同一个格式字符串中,混合使用带有或不带有 position 字段的格式说明符。不带 position 字段的格式说明符,总是使用最后一个已使用参数之后的下一个参数。此外,format 函数不要求格式字符串使用全部函数参数。例如:
SELECT format('Testing %3$s, %2$s, %s', 'one', 'two', 'three');
结果:Testing three, two, three
对于安全地构造动态 SQL 语句,%I 和 %L 格式说明符特别有用。参见例 41.1。
报告文档问题
阅读 上游文档. 通过 PostgreSQL 文档反馈表单.