↑↓ 选择 ↵ 打开 ⌫ 改范围 完整检索页

pgsql.cc 提供对 postgresql.org 官网内容的中文翻译,由 Pigsty 团队维护。

受支持版本: 当前版本 (18) / 17 / 16 / 15 / 14
测试与开发版本: 19 / devel
不受支持的版本: 13 / 12 / 11 / 10 / 9.6 / 9.5 / 9.4 / 9.3 / 9.2 / 9.1 / 9.0 / 8.4 / 8.3 / 8.2 / 8.1 / 8.0 / 7.4 / 7.3 / 7.2 / 7.1

9.4. 字符串函数和操作符 #

本节描述用于检查和操作字符串值的函数和操作符。这里的字符串包括character、character varying和text类型的值。除非另有说明,这些函数和操作符都声明为接受并返回text类型。它们也可互换地接受character varying参数。在应用函数或操作符之前,character类型的值会先转换为text,因此会去除 character 值的尾随空格。

SQL定义了一些使用关键字而不是逗号来分隔参数的字符串函数。详情请见表 9.9。PostgreSQL也提供了这些函数使用常规函数调用语法的版本(参阅表 9.10)。

注意

字符串串接操作符(||)将接受非字符串输入,只要至少一个输入是一种字符串类型,如表 9.9所示。对于其他情况,可以添加到text的显式强制转换,以接受非字符串输入。

表 9.9. SQL字符串函数和操作符

函数/操作符

描述

示例

text || text → text

串接两个字符串。

'Post' || 'greSQL' → PostgreSQL

text || anynonarray → text

anynonarray || text → text

将非字符串输入转换为文本,然后将两个字符串串接起来。(非字符串输入不能是数组类型,因为那样会与数组的||操作符产生歧义。如果要串接数组的文本表示,请显式地将其转换为text。)

'Value: ' || 42 → Value: 42

btrim ( string text [, characters text ] ) → text

从string的开头和结尾移除仅由characters中字符(默认为空格)组成的最长字符串。

btrim('xyxtrimyyx', 'xyz') → trim

text IS [NOT] [form] NORMALIZED → boolean

检查字符串是否处于指定的 Unicode 规范化形式中。可选的form关键字指定形式:NFC(默认)、NFD、NFKC 或 NFKD。只有在服务器编码为UTF8时,才能使用此表达式。请注意,使用这个表达式检查规范化通常比对可能已经规范化的字符串再执行规范化要快。

U&'\0061\0308bc' IS NFD NORMALIZED → t

bit_length ( text ) → integer

返回字符串中的位数(8倍于octet_length)。

bit_length('jose') → 32

char_length ( text ) → integer

character_length ( text ) → integer

返回字符串中的字符数。

char_length('josé') → 4

lower ( text ) → text

根据数据库的区域设置规则,将字符串转换为全部小写。

lower('TOM') → tom

lpad ( string text, length integer [, fill text ] ) → text

在string前面添加字符fill(默认为空格),将其填充到长度length。如果string已经长于length,则从右侧截断。

lpad('hi', 5, 'xy') → xyxhi

ltrim ( string text [, characters text ] ) → text

从string的开头移除仅由characters中字符(默认为空格)组成的最长字符串。

ltrim('zzzytest', 'xyz') → test

normalize ( text [, form ] ) → text

将字符串转换为指定的 Unicode 规范化形式。可选的 form 关键字指定如下形式:NFC(默认值)、NFD、NFKC 或 NFKD。该函数只能在服务器编码为 UTF8 时使用。

normalize(U&'\0061\0308bc', NFC) → U&'\00E4bc'

octet_length ( text ) → integer

返回字符串的字节数。

octet_length('josé') → 5(如果服务器编码为UTF8)

octet_length ( character ) → integer

返回字符串中的字节数。由于此版本的函数直接接受character类型,它不会剥离尾随空格。

octet_length('abc '::character(4)) → 4

overlay ( string text PLACING newsubstring text FROM start integer [ FOR count integer ] ) → text

用newsubstring替换string中从第start个字符开始、长度为count个字符的子字符串。如果省略count,则默认为newsubstring的长度。

overlay('Txxxxas' placing 'hom' from 2 for 4) → Thomas

position ( substring text IN string text ) → integer

返回substring在string中首次出现的位置;如果不存在则返回零。

position('om' in 'Thomas') → 3

rpad ( string text, length integer [, fill text ] ) → text

在string后面追加字符fill(默认为空格),将其填充到长度length。如果string已经长于length,则截断它。

rpad('hi', 5, 'xy') → hixyx

rtrim ( string text [, characters text ] ) → text

从string的结尾移除仅由characters中字符(默认为空格)组成的最长字符串。

rtrim('testxxzx', 'xyz') → test

substring ( string text [ FROM start integer ] [ FOR count integer ] ) → text

提取string的子字符串:若指定了起始位置,则从第start个字符开始;若指定了长度,则在提取count个字符后停止。start和count至少需要指定一个。

substring('Thomas' from 2 for 3) → hom

substring('Thomas' from 3) → omas

substring('Thomas' for 2) → Th

substring ( string text FROM pattern text ) → text

提取匹配 POSIX 正则表达式的第一个子字符串;参见第 9.7.3 节。

substring('Thomas' from '...$') → mas

substring ( string text SIMILAR pattern text ESCAPE escape text ) → text

substring ( string text FROM pattern text FOR escape text ) → text

提取匹配 SQL 正则表达式的第一个子字符串;参见第 9.7.2 节。第一种形式自 SQL:2003 起由标准规定;第二种形式只出现在 SQL:1999 中,应视为已过时。

substring('Thomas' similar '%#"o_a#"_' escape '#') → oma

trim ( [ LEADING | TRAILING | BOTH ] [ characters text ] FROM string text ) → text

从string的开始、末端或两端(默认为BOTH)移除仅包含characters(默认为空格)字符的最长字符串。

trim(both 'xyz' from 'yxTomxx') → Tom

trim ( [ LEADING | TRAILING | BOTH ] [ FROM ] string text [, characters text ] ) → text

这是一个非标准的trim()语法。

trim(both from 'yxTomxx', 'xyz') → Tom

unicode_assigned ( text ) → boolean

如果字符串中的所有字符都是已分配的 Unicode 码点,则返回true;否则返回false。此函数只能在服务器编码为UTF8时使用。

upper ( text ) → text

根据数据库的区域设置规则,将字符串转换为全部大写。

upper('tom') → TOM


还有其他字符串操作函数和操作符,列在表 9.10中。(其中一些用于内部实现表 9.9中列出的SQL标准字符串函数。)此外,第 9.7 节中还描述了模式匹配操作符,第 12 章中则描述了全文检索操作符。

表 9.10. 其他字符串函数和操作符

函数/操作符

描述

示例

text ^@ text → boolean

如果第一个字符串以第二个字符串开头,则返回true(等同于starts_with()函数)。

'alphabet' ^@ 'alph' → t

ascii ( text ) → integer

返回参数的第一个字符的数字代码。在UTF8编码中,返回该字符的Unicode 码点。在其他多字节编码中,该参数必须是一个ASCII字符。

ascii('x') → 120

chr ( integer ) → text

返回给定代码的字符。在UTF8编码中该参数被视作一个Unicode 码点。在其他多字节编码中该参数必须指定一个ASCII字符。chr(0) 字符不被允许,因为文本数据类型不能存储这种字符。

chr(65) → A

concat ( val1 "any" [, val2 "any" [, ...] ] ) → text

串接所有参数的文本表示。NULL 参数被忽略。

concat('abcde', 2, NULL, 22) → abcde222

concat_ws ( sep text, val1 "any" [, val2 "any" [, ...] ] ) → text

用分隔符串接除第一个参数外的所有参数。第一个参数用作分隔符字符串,不应为NULL。其他NULL参数将被忽略。

concat_ws(',', 'abcde', 2, NULL, 22) → abcde,2,22

format ( formatstr text [, formatarg "any" [, ...] ] ) → text

根据格式字符串对参数进行格式化;参见第 9.4.1 节。这个函数类似于C函数 sprintf。

format('Hello %s, %1$s', 'World') → Hello World, World

initcap ( text ) → text

将每个单词的第一个字母转换为大写,其余字母转换为小写。单词是由非字母数字字符分隔的字母数字字符序列。

initcap('hi THOMAS') → Hi Thomas

casefold ( text ) → text

根据排序规则对输入字符串执行大小写折叠。大小写折叠与大小写转换类似,但其目的是方便字符串的不区分大小写匹配,而大小写转换的目的是将字符串转换为特定的大小写形式。此函数只能在服务器编码为UTF8时使用。

通常,大小写折叠只是将字符转换为小写,但不同排序规则可能存在例外。例如,某些字符具有两种以上的小写变体,或者会折叠为大写。

大小写折叠可能改变字符串的长度。例如,在PG_UNICODE_FAST排序规则中,ß(U+00DF)会折叠为ss。

casefold可用于 Unicode 默认无大小写匹配。它并不总能保留输入字符串的规范化形式(参见normalize)。

libc提供者不支持大小写折叠,因此casefold与lower相同。

left ( string text, n integer ) → text

返回字符串最左侧的 n 个字符;如果 n 为负,则返回除最后 |n| 个字符之外的全部字符。

left('abcde', 2) → ab

length ( text ) → integer

返回字符串中的字符数。

length('jose') → 4

md5 ( text ) → text

计算参数的 MD5 hash,结果以十六进制形式写入。

md5('abc') → 900150983cd24fb0​d6963f7d28e17f72

parse_ident ( qualified_identifier text [, strict_mode boolean DEFAULT true ] ) → text[]

将qualified_identifier拆分为一个标识符数组,去除各个标识符的引号。默认情况下,最后一个标识符之后的额外字符被视为错误;但是,如果第二个参数为false,则忽略这些额外的字符。(这种行为对于解析类似函数的对象的名称有作用。)请注意,此函数不会截断超长标识符。如果你想截断,你可以将结果转换为name[]。

parse_ident('"SomeSchema".someTable') → {SomeSchema,sometable}

pg_client_encoding ( ) → name

返回当前客户端编码名称。

pg_client_encoding() → UTF8

quote_ident ( text ) → text

为给定字符串添加适当的引号并返回,使其可用作SQL语句字符串中的标识符。仅在必要时(即字符串包含不能用于标识符的字符,或会发生大小写折叠时)添加引号。内嵌的引号会被适当地双写。另见例 41.1。

quote_ident('Foo bar') → "Foo bar"

quote_literal ( text ) → text

为给定字符串添加适当的引号并返回,使其可用作SQL语句字符串中的字符串字面量。内嵌的单引号和反斜杠会被适当地双写。注意,quote_literal在输入为 null 时返回 null;如果参数可能为 null,quote_nullable通常更合适。另见例 41.1。

quote_literal(E'O\'Reilly') → 'O''Reilly'

quote_literal ( anyelement ) → text

将给定值转换为文本,然后作为字面量加引号。内嵌的单引号和反斜杠会被适当地双写。

quote_literal(42.5) → '42.5'

quote_nullable ( text ) → text

为给定字符串添加适当的引号并返回,使其可用作SQL语句字符串中的字符串字面量;如果参数为 null,则返回NULL。内嵌的单引号和反斜杠会被适当地双写。另见例 41.1。

quote_nullable(NULL) → NULL

quote_nullable ( anyelement ) → text

将给定值转换为文本,然后作为字面量加引号;如果参数为 null,则返回NULL。内嵌的单引号和反斜杠会被适当地双写。

quote_nullable(42.5) → '42.5'

regexp_count ( string text, pattern text [, start integer [, flags text ] ] ) → integer

返回 POSIX 正则表达式pattern在string中匹配的次数;参见第 9.7.3 节。

regexp_count('123456789012', '\d\d\d', 2) → 3

regexp_instr ( string text, pattern text [, start integer [, N integer [, endoption integer [, flags text [, subexpr integer ] ] ] ] ] ) → integer

返回 POSIX 正则表达式pattern在string中第N次匹配的位置;如果没有这样的匹配,则返回零。参见第 9.7.3 节。

regexp_instr('ABCDEF', 'c(.)(..)', 1, 1, 0, 'i') → 3

regexp_instr('ABCDEF', 'c(.)(..)', 1, 1, 0, 'i', 2) → 5

regexp_like ( string text, pattern text [, flags text ] ) → boolean

检查 POSIX 正则表达式pattern是否在string中出现;参见第 9.7.3 节。

regexp_like('Hello World', 'world$', 'i') → t

regexp_match ( string text, pattern text [, flags text ] ) → text[]

返回 POSIX 正则表达式pattern与string的第一次匹配中的子字符串;参见第 9.7.3 节。

regexp_match('foobarbequebaz', '(bar)(beque)') → {bar,beque}

regexp_matches ( string text, pattern text [, flags text ] ) → setof text[]

返回 POSIX 正则表达式pattern与string的第一次匹配中的子字符串;如果使用g标志,则返回所有匹配中的子字符串。参见第 9.7.3 节。

regexp_matches('foobarbequebaz', 'ba.', 'g') →

 {bar}
 {baz}

regexp_replace ( string text, pattern text, replacement text [, flags text ] ) → text

替换第一个与 POSIX 正则表达式pattern匹配的子字符串,如果使用了g标志,则替换所有这样的匹配;参见第 9.7.3 节。

regexp_replace('Thomas', '.[mN]a.', 'M') → ThM

regexp_replace ( string text, pattern text, replacement text, start integer [, N integer [, flags text ] ] ) → text

替换第N个与 POSIX 正则表达式pattern匹配的子字符串;如果N为零,则替换所有这样的匹配。搜索从string的第start个字符开始。如果省略N,则默认为 1。参见第 9.7.3 节。

regexp_replace('Thomas', '.', 'X', 3, 2) → ThoXas

regexp_replace(string=>'hello world', pattern=>'l', replacement=>'XX', start=>1, "N"=>2) → helXXo world

regexp_split_to_array ( string text, pattern text [, flags text ] ) → text[]

使用POSIX正则表达式作为分隔符拆分string,生成一个结果的数组;参见第 9.7.3 节。

regexp_split_to_array('hello world', '\s+') → {hello,world}

regexp_split_to_table ( string text, pattern text [, flags text ] ) → setof text

使用POSIX正则表达式作为分隔符拆分string,生成一组结果;参见第 9.7.3 节。

regexp_split_to_table('hello world', '\s+') →

 hello
 world

regexp_substr ( string text, pattern text [, start integer [, N integer [, flags text [, subexpr integer ] ] ] ] ) → text

返回string中 POSIX 正则表达式pattern的第N次匹配对应的子字符串;如果没有这样的匹配,则返回NULL。参见第 9.7.3 节。

regexp_substr('ABCDEF', 'c(.)(..)', 1, 1, 'i') → CDEF

regexp_substr('ABCDEF', 'c(.)(..)', 1, 1, 'i', 2) → EF

repeat ( string text, number integer ) → text

按number指定的次数重复string。

repeat('Pg', 4) → PgPgPgPg

replace ( string text, from text, to text ) → text

将string中所有出现的子字符串from替换为子字符串to。

replace('abcdefabcdef', 'cd', 'XX') → abXXefabXXef

reverse ( text ) → text

颠倒字符串中字符的顺序。

reverse('abcde') → edcba

right ( string text, n integer ) → text

返回字符串中的最后n个字符;如果n为负数,则返回除前 |n| 个字符之外的全部字符。

right('abcde', 2) → de

split_part ( string text, delimiter text, n integer ) → text

在出现delimiter时拆分string,并返回第n个字段(从一开始计数);如果n为负数,则返回倒数第 |n| 个字段。

split_part('abc~@~def~@~ghi', '~@~', 2) → def

split_part('abc,def,ghi,jkl', ',', -2) → ghi

starts_with ( string text, prefix text ) → boolean

如果 string 以 prefix开始就返回真。

starts_with('alphabet', 'alph') → t

string_to_array ( string text, delimiter text [, null_string text ] ) → text[]

将string按delimiter分割,并将结果字段形成text数组。如果delimiter是NULL,则string中的每个字符将成为数组中的一个单独元素。如果delimiter是空字符串,则string被视为单个字段。如果提供了null_string且不是NULL,则匹配该字符串的字段将被NULL替换。另请参见array_to_string。

string_to_array('xx~~yy~~zz', '~~', 'yy') → {xx,NULL,zz}

string_to_table ( string text, delimiter text [, null_string text ] ) → setof text

在出现delimiter 时拆分string,并将结果字段作为text行的集合返回。如果delimiter为NULL,则string中的每个字符将成为结果的单独一行。如果delimiter为空字符串,则将string视为单个字段。如果提供了null_string,并且不是NULL,则匹配该字符串的字段将被NULL替换。

string_to_table('xx~^~yy~^~zz', '~^~', 'yy') →

 xx
 NULL
 zz

strpos ( string text, substring text ) → integer

返回substring在string中首次出现的位置;如果不存在则返回零。(与position(substring in string)相同,但请注意参数顺序相反。)

strpos('high', 'ig') → 2

substr ( string text, start integer [, count integer ] ) → text

提取string中从第start个字符开始的子字符串;若指定了长度,则提取count个字符。(与substring(string from start for count)相同。)

substr('alphabet', 3) → phabet

substr('alphabet', 3, 2) → ph

to_ascii ( string text ) → text

to_ascii ( string text, encoding name ) → text

to_ascii ( string text, encoding integer ) → text

将string从其他编码转换为ASCII,源编码可以用名称或编号指定。如果省略encoding,则使用数据库编码(实际上,这也是唯一有用的情况)。转换主要是去除重音符号。只支持从LATIN1、LATIN2、LATIN9和WIN1250编码转换。(另一种更灵活的解决方案参见unaccent模块。)

to_ascii('Karél') → Karel

to_bin ( integer ) → text

to_bin ( bigint ) → text

将数字转换为等价的二进制补码表示。

to_bin(2147483647) → 1111111111111111111111111111111

to_bin(-1234) → 11111111111111111111101100101110

to_hex ( integer ) → text

to_hex ( bigint ) → text

将数字转换为等价的十六进制补码表示。

to_hex(2147483647) → 7fffffff

to_hex(-1234) → fffffb2e

to_oct ( integer ) → text

to_oct ( bigint ) → text

将数字转换为等价的八进制补码表示。

to_oct(2147483647) → 17777777777

to_oct(-1234) → 37777775456

translate ( string text, from text, to text ) → text

将string中与from集合中匹配的每个字符替换为to集合中相应的字符。如果from长于to,输入中出现的from中的额外字符会被删除。

translate('12345', '143', 'ax') → a2x5

unistr ( text ) → text

解析参数中转义的 Unicode 字符。Unicode字符可以被指定为\XXXX(4 个十六进制数字),\+XXXXXX(6 个十六进制数字),\uXXXX(4 个十六进制数字),或\UXXXXXXXX(8 个十六进制数字)。要指定反斜杠,请写入两个反斜杠。所有其他字符均按字面解释。

如果服务器编码不是 UTF-8,由这些转义序列之一标识的 Unicode 码点将被转换为实际的服务器编码;如果无法转换,则会报告错误。

此函数提供了带 Unicode 转义的字符串常量的另一种(非标准)写法(参见第 4.1.2.3 节)。

unistr('d\0061t\+000061') → data

unistr('d\u0061t\U00000061') → data


concat、concat_ws和format是可变参数函数,因此可以把要串接或格式化的值作为一个标记了VARIADIC关键字的数组进行传递(见第 36.5.6 节)。数组的元素被当作函数的独立普通参数一样处理。如果可变参数数组为 NULL,concat和concat_ws返回 NULL,但format把 NULL 当作一个零元素数组。

还可以参阅第 9.21 节中的聚合函数string_agg,以及表 9.13中的字符串和bytea类型之间转换的函数。

9.4.1. format #

函数format根据一个格式字符串产生格式化的输出,其形式类似于 C 函数sprintf。

format(formatstr text [, formatarg "any" [, ...] ])

formatstr是指定结果格式的字符串。格式字符串中的文本会直接复制到结果中,但格式说明符所在的位置除外。格式说明符充当字符串中的占位符,定义如何格式化后续函数参数并将其插入结果。每个formatarg参数都按照其数据类型通常的输出规则转换为文本,再根据格式说明符进行格式化并插入结果字符串。

格式说明符以%字符开头,格式如下:

%[position][flags][width]type

其中各组成字段为:

position(可选)#

一个形式为n$的字符串,其中n是要打印的参数的索引。索引 1 表示formatstr之后的第一个参数。如果position被省略,默认会使用序列中的下一个参数。

flags(可选)#

用于控制格式说明符输出格式的附加选项。目前唯一支持的标志是减号(-),它使格式说明符的输出左对齐。只有同时指定了width字段时,它才有效。

width(可选)#

指定用于显示格式说明符输出的最小字符数。输出将在左部或右部(取决于-标志)用空格填充,以达到该宽度。太小的宽度设置不会导致输出被截断,但是会被简单地忽略。宽度可以使用下列形式之一指定:一个正整数;一个星号(*)表示使用下一个函数参数作为宽度;或者一个形式为*n$的字符串表示使用第n个函数参数作为宽度。

如果宽度来自一个函数参数,会先使用该宽度参数,再使用作为格式说明符值的参数。如果宽度参数为负数,结果会在长度为abs(width)的字段中左对齐(如同指定了-标志)。

type(必需)#

格式转换的类型,用于产生格式说明符的输出。支持下面的类型:

  • s将参数值格式化为一个简单字符串。空值会被视为空字符串。

  • I将参数值视作 SQL 标识符,并在必要时用双引号包围它。如果参数为 null,则会报错(等效于quote_ident)。

  • L将参数值作为 SQL 字面量加引号。null 值显示为不带引号的字符串NULL(等效于quote_nullable)。

除了以上所述的格式说明符之外,要输出一个字面形式的%字符,可以使用特殊序列%%。

下面是一些基本格式转换的示例:

SELECT format('Hello %s', 'World');
结果:Hello World

SELECT format('Testing %s, %s, %s, %%', 'one', 'two', 'three');
结果:Testing one, two, three, %

SELECT format('INSERT INTO %I VALUES(%L)', 'Foo bar', E'O\'Reilly');
结果:INSERT INTO "Foo bar" VALUES('O''Reilly')

SELECT format('INSERT INTO %I VALUES(%L)', 'locations', 'C:\Program Files');
结果:INSERT INTO locations VALUES('C:\Program Files')

下面是使用width字段和-标志的示例:

SELECT format('|%10s|', 'foo');
结果:|       foo|

SELECT format('|%-10s|', 'foo');
结果:|foo       |

SELECT format('|%*s|', 10, 'foo');
结果:|       foo|

SELECT format('|%*s|', -10, 'foo');
结果:|foo       |

SELECT format('|%-*s|', 10, 'foo');
结果:|foo       |

SELECT format('|%-*s|', -10, 'foo');
结果:|foo       |

这些示例展示了如何使用position字段:

SELECT format('Testing %3$s, %2$s, %1$s', 'one', 'two', 'three');
结果:Testing three, two, one

SELECT format('|%*2$s|', 'foo', 10, 'bar');
结果:|       bar|

SELECT format('|%1$*2$s|', 'foo', 10, 'bar');
结果:|       foo|

不同于标准 C 函数sprintf,PostgreSQL的format函数允许在同一个格式字符串中,混合使用带有或不带有position字段的格式说明符。不带position字段的格式说明符,总是使用最后一个已使用参数之后的下一个参数。此外,format函数不要求格式字符串使用全部函数参数。例如:

SELECT format('Testing %3$s, %2$s, %s', 'one', 'two', 'three');
结果:Testing three, two, three

对于安全地构造动态 SQL 语句,%I和%L格式说明符特别有用。参见例 41.1。

提交更正

译文有误、术语不当或页面显示问题,请到译文仓库 pgsty/pgdoc 报告译文问题。英文原文本身的问题请通过上游文档表单反馈给 PostgreSQL 文档维护者。