pg_dump
pg_dump — 将 PostgreSQL 数据库导出为 SQL 脚本或其他格式
大纲
pg_dump [connection-option...] [option...] [dbname]
描述
pg_dump 是一个用于导出 PostgreSQL 数据库的工具。即使数据库正在被并发使用,它也能生成一致的导出结果。pg_dump 不会阻塞其他用户访问数据库(无论读还是写)。不过请注意,除了简单场景之外,pg_dump 通常并不是对生产数据库进行常规备份的正确选择。进一步讨论见第 25 章。
pg_dump 只转储单个数据库。要导出整个集簇,或者导出一个集簇中所有数据库共有的全局对象(如角色和表空间),请使用 pg_dumpall。
转储可以输出为脚本格式或归档文件格式。脚本转储是纯文本文件,包含把数据库重建到保存时状态所需的 SQL 命令。要从这样的脚本恢复,只需将其交给 psql。脚本文件甚至可以在其他机器和其他体系结构上用于重建数据库;经过一些修改后,甚至也可以用于其他 SQL 数据库产品。
另一类归档文件格式必须结合 pg_restore 来重建数据库。它们允许 pg_restore 有选择地恢复某些内容,甚至在恢复之前重新排列条目。归档文件格式被设计为可跨体系结构移植。
使用归档文件格式并配合 pg_restore 时,pg_dump 提供了一种灵活的归档和传输机制。pg_dump 可用于导出整个数据库,而
pg_restore 可用于检查归档和/或选择要恢复的数据库部分。最灵活的输出文件格式是“custom”格式(-Fc)和“directory”格式(-Fd)。它们允许选择和重新排序所有归档条目,支持并行恢复,并且默认会压缩。只有“directory”格式支持并行转储。
运行 pg_dump 时,应检查输出中是否有任何警告(打印到标准错误),尤其要结合下面列出的限制来查看。
警告
恢复转储会导致目标端执行由源超级用户选择的任意代码。部分转储和部分恢复并不会限制这一点。如果源超级用户不可信,则必须在恢复前检查转储得到的
SQL 语句。非纯文本转储可以使用 pg_restore 的
--file 选项进行检查。注意,运行转储和恢复的客户端无需信任源或目标超级用户。
选项
以下命令行选项控制输出的内容和格式。
dbname#指定要转储的数据库名称。如果未指定,则使用环境变量
PGDATABASE。如果未设置该变量,则使用连接指定的用户名。-a--data-only#只转储数据,不转储模式(数据定义)或统计信息。会转储表数据、大对象和序列值。
此选项类似于指定
--section=data,但出于历史原因,两者并不完全相同。-b--large-objects--blobs(已弃用)#在转储中包含大对象。除非指定了
--schema、--table、--schema-only、--statistics-only或--no-data,否则这是默认行为。因此,-b开关只在已经请求了特定模式或表的转储中,需要把大对象再加回来时才有用。注意,大对象被视为数据,因此在使用--data-only时会包含,在使用--schema-only或--statistics-only时则不会包含。-B--no-large-objects--no-blobs(已弃用)#在转储中排除大对象。
当同时给出
-b和-B时,行为是在转储数据时输出大对象,请参阅-b文档。-c--clean#在输出创建这些对象的命令之前,先输出用于
DROP所有被转储数据库对象的命令。当恢复要覆盖现有数据库时,此选项很有用。如果目标数据库中某些对象不存在,则在恢复期间会报告可忽略的错误信息,除非还指定了--if-exists。当生成一个归档(非文本)输出文件时,此选项将被忽略。对于归档格式,可以在调用
pg_restore时指定该选项。-C--create#让输出以创建数据库本身并重新连接到新建数据库的命令开始。(使用这种形式的脚本时,在目标安装中先连接到哪个数据库再运行脚本都无关紧要。)如果还指定了
--clean,则脚本会在重新连接到目标数据库之前先删除并重新创建它。使用
--create时,输出还会包含该数据库的注释(如果有),以及该数据库特有的任何配置变量设置,也就是提及该数据库的任何ALTER DATABASE ... SET ...和ALTER ROLE ... IN DATABASE ... SET ...命令。除非指定了--no-acl,否则数据库本身的访问权限也会被转储。当生成一个归档(非文本)输出文件时,此选项将被忽略。对于归档格式,可以在调用
pg_restore时指定该选项。-epattern--extension=#pattern仅转储与
pattern匹配的扩展。当未指定此选项时,将转储目标数据库中的所有非系统扩展。可以通过写多个-e开关来选择多个扩展。pattern参数按照 psql 的\d命令所使用的同样规则进行解释(请参阅模式),因此也可以通过在模式中使用通配符来选择多个扩展。使用通配符时,如有需要请小心为模式加引号,以防止 shell 展开通配符。由
pg_extension_config_dump注册的任何配置关系,如果其所属扩展由--extension指定,也会包含在转储中。注意
当指定
-e选项时,pg_dump 不会尝试转储所选扩展可能依赖的任何其他数据库对象。因此,不能保证特定扩展的转储结果可以成功地单独恢复到一个干净的数据库中。-Eencoding--encoding=#encoding在指定的字符集编码中创建转储。默认情况下,转储将以数据库编码创建。(获得相同结果的另一种方法是将
PGCLIENTENCODING环境变量设置为所需的转储编码。)支持的编码在第 23.3.1 节中描述。-ffile--file=#file将输出发送到指定文件。对于基于文件的输出格式,可以省略此参数,这时使用标准输出。不过,对于目录输出格式,必须给出此参数,因为它指定的是目标目录而不是文件。在这种情况下,该目录由
pg_dump创建,并且在此之前必须不存在。-Fformat--format=#format选择输出的格式。
format可以是以下之一:pplain#输出纯文本 SQL 脚本文件(默认)。
ccustom#输出适合供 pg_restore 使用的 custom 格式归档。与目录输出格式一起,这是最灵活的输出格式,因为它允许在恢复时手工选择并重新排序归档条目。这种格式默认也会压缩。
ddirectory#输出适合供 pg_restore 使用的 directory 格式归档。这会创建一个目录,其中每个被转储的表和大对象各有一个文件,外加一个所谓的目录表(Table of Contents)文件,以机器可读格式描述被转储对象,pg_restore 可以读取它。directory 格式归档可以用标准 Unix 工具来操作;例如,未压缩归档中的文件可以使用 gzip、lz4 或 zstd 工具进行压缩。该格式默认使用
gzip压缩,并且支持并行转储。ttar#输出
tar格式归档,适合供 pg_restore 使用。tar 格式与 directory 格式兼容:解开一个 tar 格式归档就会得到一个有效的 directory 格式归档。不过,tar 格式不支持压缩。另外,使用 tar 格式时,在恢复过程中不能改变表数据项的相对顺序。
-jnjobs--jobs=#njobs以并行方式运行转储,同时转储
njobs个表。此选项可能减少执行转储所需的时间,但也会增加数据库服务器的负载。只能在目录输出格式下使用此选项,因为只有这种输出格式允许多个进程同时写入数据。pg_dump 将打开
njobs+ 1 个数据库连接,因此请确保 max_connections 设置足够高,能够容纳所有连接。在并行转储运行期间请求数据库对象上的排他锁,可能导致转储失败。原因是 pg_dump 的领导者进程会对稍后由工作进程转储的对象请求共享锁(ACCESS SHARE),以确保在转储运行期间没有人删除这些对象。如果另一个客户端随后请求某个表上的排他锁,该锁不会被授予,而是会排队等待领导者进程释放共享锁。于是,对该表的任何其他访问也都不会被授予,并会排在该排他锁请求之后,其中包括试图转储该表的工作进程。如果没有任何预防措施,这就会形成一个经典的死锁场景。为检测这种冲突,pg_dump 工作进程会使用
NOWAIT选项再请求一个共享锁。如果工作进程拿不到这个共享锁,就说明这期间已经有人请求了排他锁,而此时已经无法继续转储,因此 pg_dump 只能中止转储。要执行并行转储,数据库服务器需要支持同步快照。这一特性是在 PostgreSQL 9.2 中为主库引入的,在 10 中为备库引入。有了这个特性,数据库客户端即使使用不同连接,也能保证看到相同的数据集。
pg_dump -j会使用多个数据库连接:它会先由领导者进程连接数据库一次,然后每个工作任务再各连一次。若没有同步快照特性,就无法保证各个工作任务在各自连接中看到相同的数据,这可能导致备份不一致。-npattern--schema=#pattern只转储匹配
pattern的模式;这既会选择模式本身,也会选择其中包含的所有对象。未指定此选项时,将转储目标数据库中的所有非系统模式。可以通过写多个-n开关来选择多个模式。pattern参数按照 psql 的\d命令所使用的同样规则进行解释(见模式),因此也可以通过在模式中使用通配符来选择多个模式。使用通配符时,如有需要请小心为模式加引号,以防止 shell 展开通配符;见下文的示例。注意
当指定
-n时,pg_dump 不会尝试转储所选模式可能依赖的任何其他数据库对象。因此,不能保证特定模式转储的结果能够单独成功恢复到一个干净的数据库中。注意
指定
-n时,不会转储大对象等非模式对象。可以使用--large-objects开关把大对象加回转储中。-Npattern--exclude-schema=#pattern不转储任何匹配
pattern的模式。该模式按照与-n相同的规则解释。-N可以给出多次,以排除匹配所给模式中任意一个的模式。当同时给出
-n和-N时,其行为是只转储至少匹配一个-n开关但不匹配任何-N开关的模式。如果出现-N而没有-n,那么匹配-N的模式会从原本的正常转储中排除。-O--no-owner#不输出用于把对象所有权设置成与原始数据库一致的命令。默认情况下,pg_dump 会发出
ALTER OWNER或SET SESSION AUTHORIZATION语句来设置新建数据库对象的所有权。除非脚本由超级用户(或拥有脚本中所有对象的同一用户)启动,否则这些语句会在运行脚本时报错。若要创建一个可由任意用户恢复、并让该用户拥有所有对象的脚本,请指定-O。当生成一个归档(非文本)输出文件时,此选项将被忽略。对于归档格式,可以在调用
pg_restore时指定该选项。-R--no-reconnect#这个选项已经过时,但仍然被接受以保持向后兼容性。
-s--schema-only#只转储对象定义(模式),不转储数据或统计信息。
此选项不能与
--data-only或--statistics-only一起使用。它类似于指定--section=pre-data --section=post-data,但出于历史原因,两者并不完全相同。(不要把它与
--schema选项混淆,后者中的“schema”一词含义不同。)要只排除数据库中某些表的表数据,请参见
--exclude-table-data。-Susername--superuser=#username指定在禁用触发器时要使用的超级用户名。这只在使用
--disable-triggers时相关。(通常最好省略它,而是以超级用户身份运行生成的脚本。)-tpattern--table=#pattern只转储名称匹配
pattern的表。可以通过写多个-t开关来选择多个表。pattern参数按照 psql 的\d命令所使用的同样规则进行解释(见模式),因此也可以通过在模式中使用通配符来选择多个表。使用通配符时,如有需要请小心为模式加引号,以防止 shell 展开通配符;见下文的示例。除了表之外,此选项还可用于转储匹配的视图、物化视图、外部表和序列的定义。它不会转储视图或物化视图的内容,而外部表的内容只有在使用
--include-foreign-data指定了相应外部服务器时才会被转储。使用
-t时,-n和-N开关没有作用,因为由-t选中的表无论这些开关如何设置都会被转储,而非表对象则不会被转储。注意
当指定
-t时,pg_dump 不会尝试转储所选表可能依赖的任何其他数据库对象。因此,不能保证特定表转储的结果能够单独成功恢复到一个干净的数据库中。-Tpattern--exclude-table=#pattern不转储任何匹配
pattern的表。该模式按照与-t相同的规则解释。-T可以给出多次,以排除匹配所给模式中任意一个的表。当同时给出
-t和-T时,其行为是只转储至少匹配一个-t开关但不匹配任何-T开关的表。如果出现-T而没有-t,那么匹配-T的表会从原本的正常转储中排除。-v--verbose#指定详细模式。这会使 pg_dump 将详细的对象注释、开始/停止时间写入转储文件,并把进度消息写到标准错误。重复该选项会让更多调试级别消息出现在标准错误中。
-V--version#打印 pg_dump 的版本并退出。
-x--no-privileges--no-acl#不转储访问权限(grant/revoke 命令)。
-Zlevel-Z[:methoddetail]--compress=level--compress=[:methoddetail] #指定要使用的压缩方法和/或压缩级别。压缩方法可以设置为
gzip、lz4、zstd或none(表示不压缩)。也可以选择指定压缩细节字符串。如果细节字符串是一个整数,则表示压缩级别;否则,它应是一个用逗号分隔的项列表,每项形如keyword或keyword=value。目前支持的关键字是level和long。如果未指定压缩级别,将使用默认压缩级别。如果只指定级别而未说明算法,当级别大于
0时将使用gzip压缩,当级别为0时则不使用压缩。对于 custom 和 directory 归档格式,此选项指定对各个表数据段的压缩,默认是使用中等级别的
gzip进行压缩。对于纯文本输出,设置非零压缩级别会导致整个输出文件被压缩,就像它经过了 gzip、lz4 或 zstd 一样;但默认是不压缩。使用 zstd 压缩时,long模式可能提高压缩比,但代价是内存使用增加。tar 归档格式目前完全不支持压缩。
--binary-upgrade#此选项供就地升级实用程序使用。不建议也不支持将其用于其他目的。该选项的行为可能在未来的版本中更改而不另行通知。
--column-inserts--attribute-inserts#将数据转储为带有显式列名的
INSERT命令(INSERT INTO)。这会使恢复变得非常缓慢;它主要用于生成可装入非 PostgreSQL 数据库的转储文件。恢复期间发生的任何错误都只会导致有问题的table(column, ...) VALUES ...INSERT所包含的行丢失,而不会导致整个表内容丢失。--disable-dollar-quoting#此选项禁用对函数体的美元引用,并强制用 SQL 标准字符串语法对它们加引号。
--disable-triggers#此选项只在创建包含数据但不包含模式的转储时才相关。它指示 pg_dump 在输出中包含一些命令,以便在恢复数据时临时禁用目标表上的触发器。如果这些表上存在不希望在数据恢复期间触发的引用完整性检查或其他触发器,请使用此选项。
目前,为
--disable-triggers输出的这些命令必须由超级用户执行。因此,还应通过-S指定一个超级用户名,或者更好的做法是谨慎地以超级用户身份运行生成的脚本。当生成一个归档(非文本)输出文件时,此选项将被忽略。对于归档格式,可以在调用
pg_restore时指定该选项。--enable-row-security#此选项只在转储启用了行安全的表内容时才相关。默认情况下,pg_dump 会将 row_security 设置为 off,以确保把表中的所有数据都转储出来。如果用户没有足够的权限绕过行安全,则会抛出错误。该参数会指示 pg_dump 改为将 row_security 设置为 on,从而允许用户只转储其有权访问的那部分表内容。
请注意,如果当前使用此选项,通常还会希望让转储采用
INSERT格式,因为恢复期间的COPY FROM不支持行安全。--exclude-extension=#pattern不转储任何匹配
pattern的扩展。该模式按照与-e相同的规则解释。--exclude-extension可以给出多次,以排除匹配所给模式中任意一个的扩展。当同时给出
-e和--exclude-extension时,其行为是只转储至少匹配一个-e开关、但不匹配任何--exclude-extension开关的扩展。如果--exclude-extension在没有-e的情况下出现,那么匹配--exclude-extension的扩展会从原本的正常转储中排除。--exclude-table-and-children=#pattern这与
-T/--exclude-table选项相同,只是它还会排除匹配pattern的表的任何分区或继承子表。--exclude-table-data=#pattern不转储任何匹配
pattern的表的数据。该模式按照与-t相同的规则解释。--exclude-table-data可以给出多次,以排除匹配所给模式中任意一个的表。当需要某个特定表的定义、但不需要其中数据时,此选项很有用。若要排除数据库中所有表的数据,请参见
--schema-only或--statistics-only。--exclude-table-data-and-children=#pattern这与
--exclude-table-data选项相同,只是它还会排除匹配pattern的表的任何分区或继承子表的数据。--extra-float-digits=#ndigits在转储浮点数据时,使用指定的
extra_float_digits值,而不是最大可用精度。出于备份目的的常规转储不应使用此选项。--filter=#filename指定一个文件名,从中读取要在转储中包含或排除的对象匹配模式。模式按照对应选项的同样规则解释:对于表,使用
-t/--table、--table-and-children、-T/--exclude-table和--exclude-table-and-children的规则;对于模式,使用-n/--schema和-N/--exclude-schema的规则;对于外部服务器上的数据,使用--include-foreign-data的规则;对于表数据,使用--exclude-table-data和--exclude-table-data-and-children的规则;对于扩展,使用-e/--extension和--exclude-extension的规则。若要从STDIN读取,请使用-作为文件名。--filter选项可以与上述包含或排除对象的选项一起使用,也可以为多个过滤文件指定多次。文件每行列出一个对象匹配模式,格式如下:
{ include | exclude } { extension | foreign_data | table | table_and_children | table_data | table_data_and_children | schema }PATTERN第一个关键字指定是包含还是排除与模式匹配的对象。第二个关键字指定要用该模式过滤的对象类型:
extension:扩展。作用类似-e/--extension或--exclude-extension选项。foreign_data:外部服务器上的数据。作用类似--include-foreign-data选项。这个关键字只能与include关键字一起使用。table:表。作用类似-t/--table或-T/--exclude-table选项。table_and_children:表,以及其任何分区或继承子表。作用类似--table-and-children或--exclude-table-and-children选项。table_data:任何匹配pattern的表的数据。作用类似--exclude-table-data选项。这个关键字只能与exclude关键字一起使用。table_data_and_children:任何匹配pattern的表的数据,以及这些表的任何分区或继承子表的数据。作用类似--exclude-table-data-and-children选项。这个关键字只能与exclude关键字一起使用。schema:模式。作用类似-n/--schema或-N/--exclude-schema选项。
以
#开头的行被视为注释并忽略。注释也可以放在对象匹配模式行之后。空白行同样会被忽略。有关如何在匹配模式中加引号,请参见模式。示例文件见下文的示例一节。
--if-exists#使用
DROP ... IF EXISTS命令在--clean模式下删除对象。这会抑制原本可能报告的“does not exist”错误信息。除非同时指定了--clean,否则此选项无效。--include-foreign-data=#foreignserver转储任何外部表的数据,只要其外部服务器匹配
foreignserver模式。可以通过写多个--include-foreign-data开关来选择多个外部服务器。此外,foreignserver参数按照 psql 的\d命令所使用的同样规则进行解释(见模式),因此也可以通过在模式中使用通配符来选择多个外部服务器。使用通配符时,如有需要请小心为模式加引号,以防止 shell 展开通配符;见下文的示例。唯一的例外是不允许空模式。注意
在
--include-foreign-data中使用通配符,可能导致访问到意料之外的外部服务器。另外,为了安全地使用此选项,请确保所命名服务器的所有者是可信的。注意
指定
--include-foreign-data时,pg_dump 不会检查外部表是否可写。因此,不能保证外部表转储的结果一定能够成功恢复。--inserts#把数据转储为
INSERT命令(而不是COPY)。这会使恢复非常缓慢;它主要用于生成可装入非 PostgreSQL 数据库的转储。恢复期间发生的任何错误都只会导致有问题的INSERT所包含的行丢失,而不会导致整个表内容丢失。注意,如果重新安排了列顺序,恢复可能会彻底失败。--column-inserts选项可以避免列顺序变化带来的问题,但速度更慢。--load-via-partition-root#当为表分区转储数据时,让
COPY或INSERT语句以包含该分区的分区层次结构根为目标,而不是以该分区本身为目标。这会导致在加载数据时为每一行重新确定适当的分区。当在另一台服务器上恢复数据,而行并不总是落在与原始服务器相同的分区中时,这可能很有用。例如,如果分区列是 text 类型,而两个系统对用于排序该分区列的排序规则定义不同,就可能发生这种情况。--lock-wait-timeout=#timeout在转储开始时,不要无限等待获取共享表锁。如果无法在指定的
timeout内锁定某个表,就让转储失败。超时可以用SET statement_timeout接受的任意格式指定。(允许的格式因被转储源服务器的版本而异,但所有版本都接受以毫秒为单位的整数。)--no-comments#不要转储
COMMENT命令。--no-data#不要转储数据。
--no-policies#不要转储行安全性策略。
--no-publications#不要转储发布。
--no-schema#不要转储模式(数据定义)。
--no-security-labels#不要转储安全标签。
--no-statistics#不要转储统计信息。这是默认行为。
--no-subscriptions#不要转储订阅。
--no-sync#默认情况下,
pg_dump会等待所有文件都被安全写入磁盘。该选项会使pg_dump立即返回而不等待,这样更快,但意味着随后如果操作系统崩溃,转储可能会损坏。通常,此选项适用于测试,但不应在从生产安装转储数据时使用。--no-table-access-method#不输出用于选择表访问方法的命令。使用此选项时,所有对象在恢复时都会使用当时默认的表访问方法创建。
当生成一个归档(非文本)输出文件时,此选项将被忽略。对于归档格式,可以在调用
pg_restore时指定该选项。--no-tablespaces#不输出用于选择表空间的命令。使用此选项时,所有对象在恢复时都会创建在当时默认的表空间中。
当生成一个归档(非文本)输出文件时,此选项将被忽略。对于归档格式,可以在调用
pg_restore时指定该选项。--no-toast-compression#不输出用于设置 TOAST 压缩方法的命令。使用此选项时,所有列都会以默认压缩设置恢复。
--no-unlogged-table-data#不要转储不记录 WAL 的表和序列的内容。此选项不会影响是否转储表和序列的定义(模式);它只会抑制表和序列数据的转储。从备库转储时,不记录 WAL 的表和序列中的数据始终会被排除。
--on-conflict-do-nothing#添加
ON CONFLICT DO NOTHING到INSERT命令中。除非同时指定了--inserts、--column-inserts或--rows-per-insert,否则此选项无效。--quote-all-identifiers#强制为所有标识符加引号。当从某个服务器转储数据库,而该服务器的 PostgreSQL 主版本与 pg_dump 不同,或者输出打算装入另一主版本的服务器时,推荐使用此选项。默认情况下,pg_dump 只会为在其自身主版本中属于保留字的标识符加引号。这有时会在处理其他版本服务器时导致兼容性问题,因为这些版本的保留字集合可能略有不同。使用
--quote-all-identifiers可以防止此类问题,但代价是转储脚本更难阅读。--restrict-key=#restrict_key在转储输出中,把给定字符串用作 psql 的
\restrict键。此选项只能用于纯文本转储,也就是--format被设置为plain,或者省略了--format选项时。若未指定该键,pg_dump 会按需要随机生成一个。键只能包含字母数字字符。此选项主要用于测试以及其他需要可重复输出的场景(例如比较转储文件)。一般不建议使用它,因为若恶意服务器事先知道该键,可能能够注入任意代码,并在运行 psql 处理转储输出的机器上执行。
--rows-per-insert=#nrows将数据转储为
INSERT命令(而不是COPY)。它控制每个INSERT命令的最大行数。指定的值必须是大于零的数字。恢复过程中的任何错误将导致只有属于有问题的INSERT的行丢失,而不是整个表的内容。--section=#sectionname仅转储指定的部分。部分名称可以是
pre-data、data或post-data。可以多次指定此选项以选择多个部分。默认情况下是转储所有部分。数据部分包含实际的表数据、大对象内容、序列值,以及表、物化视图和外部表的统计信息。post-data 部分包括索引、触发器、规则、索引统计信息,以及除已验证的检查约束和非空约束之外的其他约束定义。pre-data 部分包括所有其他数据定义项。
--sequence-data#在转储中包含序列数据。除非指定了
--no-data、--schema-only或--statistics-only,否则这是默认行为。--serializable-deferrable#使用
serializable事务来执行转储,以确保所用快照与后续数据库状态一致;但这是通过等待事务流到达一个不会出现异常的时点来实现的,从而避免转储失败或导致其他事务因serialization_failure而回滚。有关事务隔离和并发控制的更多信息,请参见第 13 章。这个选项对于仅用于灾难恢复的转储没有好处。但对于用来加载数据库副本,以供报表或其他只读负载共享,而原始数据库继续更新的转储,它可能有用。如果不使用它,转储可能反映出一种与最终提交事务的任何串行执行都不一致的状态。例如,如果使用批处理技术,转储中可能显示某个批次已经关闭,但批次中的全部条目却并未出现。
如果在启动 pg_dump 时没有活动的读写事务,此选项不会带来任何差别。如果存在活动的读写事务,转储开始时间可能会被延迟一个不确定的时长。一旦开始运行,使用或不使用该开关的性能都是相同的。
--snapshot=#snapshotname在制作数据库转储时,使用指定的同步快照(详见表 9.100)。
当需要将转储与逻辑复制槽(参见第 47 章)或与并发会话同步时,此选项很有用。
在并行转储的情况下,将使用此选项定义的快照名称,而不是重新获取一个新快照。
--statistics#转储优化器统计信息。
--statistics-only#只转储统计信息,不转储模式(数据定义)或数据。会转储表、物化视图、外部表和索引的优化器统计信息。
--strict-names#要求每个扩展(
-e/--extension)、模式(-n/--schema)和表(-t/--table)模式在要转储的数据库中至少匹配一个扩展/模式/表。这也适用于配合--filter使用的过滤器。请注意,如果所有扩展/模式/表模式都找不到匹配项,那么 pg_dump 即使在不使用--strict-names的情况下也会报错。此选项对
--exclude-extension、-N/--exclude-schema、-T/--exclude-table或--exclude-table-data没有效果。未匹配任何对象的排除模式不会被视为错误。--sync-method=#method当设为
fsync时(这是默认值),pg_dump --format=directory会递归打开并同步归档目录中的所有文件。在 Linux 上,也可以改用
syncfs,让操作系统同步包含归档目录的整个文件系统。关于需要注意的问题,请参见 recovery_init_sync_method 中有关使用syncfs的信息。当使用
--no-sync,或--format未设为directory时,此选项没有效果。--table-and-children=#pattern这与
-t/--table选项相同,只是它还会包含匹配pattern的表的任何分区或继承子表。--use-set-session-authorization#输出符合 SQL 标准的
SET SESSION AUTHORIZATION命令,而不是ALTER OWNER命令来确定对象所有权。这会让转储更符合标准,但根据转储中对象的历史,可能无法正确恢复。另外,使用SET SESSION AUTHORIZATION的转储肯定需要超级用户权限才能正确恢复,而ALTER OWNER只需较低权限。-?--help#显示关于 pg_dump 命令行参数的帮助信息,并退出。
以下命令行选项控制数据库连接参数。
-ddbname--dbname=#dbname指定要连接的数据库名称。这等价于在命令行上把
dbname作为第一个非选项参数指定。dbname可以是连接字符串。如果是这样,连接字符串中的参数将覆盖任何冲突的命令行选项。-hhost--host=#host指定服务器所在机器的主机名。如果值以斜杠开头,则被用作 Unix 域套接字的目录。默认值取自
PGHOST环境变量(如果已设置),否则尝试使用 Unix 域套接字连接。-pport--port=#port指定服务器正在监听连接的 TCP 端口,或本地 Unix 域套接字文件扩展名。默认值取自
PGPORT环境变量(如果已设置),否则使用编译时默认值。-Uusername--username=#username用于连接的用户名。
-w--no-password#绝不发出密码提示。如果服务器要求密码认证,而又无法通过
.pgpass文件等其他方式获得密码,则连接尝试将失败。在没有用户在场输入密码的批处理作业和脚本中,此选项很有用。-W--password#强制 pg_dump 在连接数据库之前提示输入密码。
这个选项绝非必需,因为如果服务器要求密码认证,pg_dump 会自动提示输入密码。不过,pg_dump 会先浪费一次连接尝试来发现服务器需要密码。在某些情况下值得输入
-W,因为可以避免这次额外的连接尝试。--role=#rolename指定用于创建转储的角色名称。此选项会让 pg_dump 在连接数据库后发出
SET ROLErolename命令。当已认证用户(由-U指定)缺少 pg_dump 所需权限,但可以切换到具有所需权限的角色时,此选项很有用。有些安装环境有禁止直接以超级用户登录的策略,使用此选项就可以在不违反该策略的情况下进行转储。
环境
与大多数其他 PostgreSQL 工具一样,此工具也使用 libpq 支持的环境变量(见第 32.15 节)。
诊断
pg_dump 在内部执行 SELECT
语句。如果运行 pg_dump 时遇到问题,请确认能够例如使用 psql 从数据库中查询信息。此外,libpq 前端库所使用的任何默认连接设置和环境变量也都会生效。
pg_dump 的数据库活动通常会被累积统计系统收集。如果不希望如此,可以将参数 track_counts 通过
PGOPTIONS 或 ALTER USER 命令设置为
false。
注解
如果数据库集簇在 template1 数据库中有任何本地添加的内容,要小心把 pg_dump 的输出恢复到一个真正空的数据库中;否则很可能因为这些新增对象的重复定义而报错。要创建一个不含任何本地添加的空数据库,应从 template0 而不是
template1 复制,例如:
CREATE DATABASE foo WITH TEMPLATE template0;
当选择不包含模式的转储并使用 --disable-triggers 选项时,pg_dump 会在插入数据前发出命令禁用用户表上的触发器,并在数据插入完成后发出命令重新启用它们。如果恢复在中途停止,系统目录可能会保持在错误状态。
当指定 --statistics 时,pg_dump 会在生成的转储文件中包含大多数优化器统计信息。但这并不包括所有统计信息,例如通过 CREATE STATISTICS 显式创建的统计信息、扩展添加的自定义统计信息,或由累积统计系统收集的统计信息。因此,从转储文件恢复后再运行 ANALYZE 以确保最佳性能,可能仍然有用;更多信息见第 24.1.3 节和第 24.1.6 节。
由于 pg_dump 常被用来把数据迁移到更新版本的
PostgreSQL,因此通常可以期望
pg_dump 的输出能够装载到
PostgreSQL 服务器中,而这些服务器的版本比
pg_dump 更高。pg_dump 也可以从版本比它自身更旧的
PostgreSQL 服务器上转储数据。(目前支持回溯到
9.2 版的服务器。)然而,pg_dump 不能从主版本高于它自身的 PostgreSQL 服务器上转储;它甚至会拒绝尝试,以免冒生成无效转储的风险。另外,也不能保证
pg_dump 的输出能够装载到更旧主版本的服务器上
— 即使转储正是从该版本服务器上取得的。把转储文件装载到较旧服务器时,可能需要手工编辑转储文件,移除旧服务器无法理解的语法。在跨版本场景中,建议使用 --quote-all-identifiers 选项,因为它可以防止不同 PostgreSQL 版本保留字列表差异带来的问题。
在转储逻辑复制订阅时,pg_dump 会生成
CREATE SUBSCRIPTION 命令,并带上
connect = false 选项,这样恢复订阅时就不会为了创建复制槽或执行初始表复制而建立远程连接。这样一来,无需网络访问远程服务器也能恢复转储。随后由用户以适当方式重新激活订阅。如果涉及的主机已经变化,则可能需要修改连接信息。在开始一次新的完整表复制之前,可能也适合先截断目标表。如果用户打算在刷新期间复制初始数据,则必须以 two_phase = false 创建该槽。初始同步之后,订阅者会自动启用
two_phase
选项,前提是该订阅最初是以 two_phase = true 选项创建的。
通常建议在恢复数据库时使用
-X(--no-psqlrc)选项来处理纯文本
pg_dump 脚本,以确保恢复过程干净,并防止与非默认
psql 配置发生潜在冲突。
示例
要把数据库 mydb 转储到一个 SQL 脚本文件:
$pg_dump mydb > db.sql
要把这样的脚本重新装入一个(新创建的)名为 newdb 的数据库:
$psql -X -d newdb -f db.sql
要把一个数据库转储为 custom 格式归档文件:
$pg_dump -Fc mydb > db.dump
要把一个数据库转储为 directory 格式归档:
$pg_dump -Fd mydb -f dumpdir
要使用 5 个并行工作任务把一个数据库转储为 directory 格式归档:
$pg_dump -Fd mydb -j 5 -f dumpdir
要把一个归档文件重新装入到一个(新创建的)名为
newdb 的数据库:
$pg_restore -d newdb db.dump
要把一个归档文件重新装入生成该归档的同一个数据库,并丢弃该数据库的当前内容:
$pg_restore -d postgres --clean --create db.dump
要转储一个名为 mytab 的表:
$pg_dump -t mytab mydb > db.sql
要转储 detroit 模式中名称以 emp
开头的所有表,但排除名为 employee_log 的表:
$pg_dump -t 'detroit.emp*' -T detroit.employee_log mydb > db.sql
要转储名称以 east 或 west 开头、并且以
gsm 结尾的所有模式,同时排除名称中包含单词
test 的任何模式:
$pg_dump -n 'east*gsm' -n 'west*gsm' -N '*test*' mydb > db.sql
同样,使用正则表达式记法来合并这些开关:
$pg_dump -n '(east|west)*gsm' -N '*test*' mydb > db.sql
要转储除名称以 ts_ 开头的表之外的所有数据库对象:
$pg_dump -T 'ts_*' mydb > db.sql
在 -t 及相关开关中,如果要指定一个大写或混合大小写的名称,就需要对该名称加双引号;否则它会被折叠成小写(见模式)。但双引号对 shell 来说又是特殊字符,因此反过来还必须再被引用。因此,要转储一个具有混合大小写名称的单个表,需要类似下面这样:
$pg_dump -t "\"MixedCaseName\"" mydb > mytab.sql
要转储所有名称以 mytable 开头、但排除
mytable2 表的表,请指定如下过滤文件
filter.txt:
include table mytable* exclude table mytable2
$pg_dump --filter=filter.txt mydb > db.sql
另见
pg_dumpall, pg_restore, psql报告文档问题
阅读 上游文档. 通过 PostgreSQL 文档反馈表单.