5.4. 二进制串 #
bytea数据类型允许存储二进制串,参见表 5.6。
表 5.6. 二进制串类型
| 类型名 | 存储 | 描述 |
|---|---|---|
bytea | 4字节外加实际的二进制串 | 变长(无特定限制)的二进制串 |
二进制串是字节(八位组)的序列。二进制串与字符串的区别在于两个特性:第一,二进制串明确允许存储值为零的字节和其他“不可打印”字节(定义为 32 到 126 范围之外的字节)。第二,对二进制串的操作处理实际的字节,而字符串的编码和处理依赖于区域设置。
输入 bytea
值时,在 SQL
语句中作为字符串字面量的一部分使用时,某些值的字节必须转义(但所有字节值都可以转义)。一般而言,转义一个字节时,把它转换为等于其十进制字节值的三位八进制数,并在前面加两个反斜杠。某些字节值有替代的转义序列,如表 5.7所示。
表 5.7. bytea输入转义字节
| 十进制字节值 | 描述 | 输入转义表示 | 示例 | 打印结果 |
|---|---|---|---|---|
| 0 | 0字节 | '\\000' | SELECT '\\000'::bytea; | \000 |
| 39 | 单引号 | '\''或'\\047' | SELECT '\''::bytea; | ' |
| 92 | 反斜线 | '\\\\'或'\\134' | SELECT '\\\\'::bytea; | \\ |
| 0 到 31 以及 127 到 255 | “不可打印”字节 | '\\(八进制值) | SELECT '\\001'::bytea; | \001 |
是否必须转义“不可打印”字节实际上因区域设置而异。在某些情况下你可以不转义它们。注意,表 5.7中每个示例的结果都恰好是一个字节长,尽管零字节和反斜杠多于一个字符。Bytea
的输出字节也会被转义。一般而言,每个“不可打印”字节的十进制值都会被转换为等值的三位八进制数,并在前面加一个反斜杠。大多数“可打印”字节以其在客户端字符集中的标准表示出现。十进制值为
92(反斜杠)的字节有一个特殊的替代输出表示。细节见表 5.8。
表 5.8. bytea输出转义字节
| 十进制字节值 | 描述 | 输出转义表示 | 示例 | 打印结果 |
|---|---|---|---|---|
| 92 | 反斜线 | \\ | SELECT '\\134'::bytea; | \\ |
| 0 到 31 以及 127 到 255 | “不可打印”字节 | \### (octal value) | SELECT '\\001'::bytea; | \001 |
| 32 到 126 | “可打印”字节 | 客户端字符集表示 | SELECT '\\176'::bytea; | ~ |
要使用 bytea
的字节转义记法,字符串字面量(输入串)必须包含两个反斜杠,因为它们在
PostgreSQL
服务器中必须经过两个解析器。第一个反斜杠会被字符串字面量解析器解释为转义字符并因此被消耗,留下其后的字符。剩下的反斜杠被
bytea
输入函数识别为三位八进制值的前缀。例如,以
'\\001' 形式传给后端的字符串字面量,经过字符串字面量解析器之后变成
'\001'。然后
'\001' 被送到
bytea 输入函数,在那里它被转换为十进制值为
1 的单个字节。
由于类似的原因,反斜杠必须输入为
'\\\\'(或
'\\134')。第一和第三个反斜杠会被字符串字面量解析器解释为转义字符并因此被消耗,留给
bytea
输入函数的字符串中有两个反斜杠,而该函数把它们解释为表示单个反斜杠。例如,以
'\\\\' 形式传给服务器的字符串字面量,经过字符串字面量解析器之后变成
'\\'。然后
'\\' 被送到
bytea 输入函数,在那里它被转换为十进制值为
92 的单个字节。
单引号稍有不同:它必须输入为
'\''(或
'\\047'),而不是
'\\''。这是因为,虽然字面量解析器把单引号当作特殊字符处理并会消耗那个反斜杠,但
bytea
输入函数不把单引号识别为特殊字节。因此,以
'\'' 形式传给后端的字符串字面量,经过字符串字面量解析器之后变成
'''。然后
''' 被送到
bytea 输入函数,在那里它保持其十进制值为
39 的单个字节不变。
根据你所用的
PostgreSQL
前端不同,在对
bytea
字符串进行转义和反转义方面可能还有额外的工作要做。例如,如果你的接口会自动翻译换行符和回车符,你可能还必须对它们转义。如果你所用语言的解析器也把反斜杠当作转义字符,你可能不得不把反斜杠再翻倍。
SQL 标准定义了另一种二进制串类型,称为
BLOB 或 BINARY LARGE
OBJECT。其输入格式与
bytea 不同,但提供的函数和运算符大体相同。