postgresql - 在不损失性能的情况下同时执行多个功能

标签 postgresql plpgsql database-performance query-performance postgresql-performance

我有一个必须使用 pl/pgsql 进行一系列查询的过程:

--process:
SELECT function1();
SELECT function2();
SELECT function3();
SELECT function4();

为了能够在一次调用中执行所有操作,我创建了一个流程函数:

CREATE OR REPLACE FUNCTION process()
  RETURNS text AS
$BODY$
BEGIN
    PERFORM function1();
    PERFORM function2();
    PERFORM function3();
    PERFORM function4();
    RETURN 'process ended';
END;
$BODY$
  LANGUAGE plpgsql

问题是,当我将每个函数本身花费的时间加起来时,总计为 200 秒,而函数 process() 花费的时间超过一个小时!

也许是内存问题,但我不知道应该更改 postgresql.conf 上的哪个配置。

数据库在 Debian 8 中的 PostgreSQL 9.4 上运行。

最佳答案

您评论说这 4 个函数必须连续 运行。因此,可以安全地假设每个函数都处理表中已被前一个函数修改的数据。这是我的主要嫌疑人。

任何 Postgres 函数都在外部上下文的事务中运行。因此,如果打包到另一个函数中,所有函数都共享相同的事务上下文。显然,每个人都可以看到以前功能对数据的影响。 (尽管效果对其他并发事务仍然不可见。)但统计数据不会立即更新。

查询计划基于 statistics在涉及的对象上。 PL/pgSQL 在实际执行之前不会计划语句,这对您有利。 Per documentation:

As each expression and SQL command is first executed in the function, the PL/pgSQL interpreter parses and analyzes the command to create a prepared statement, using the SPI manager's SPI_prepare function.

PL/pgSQL 可以缓存查询计划,但只能在同一 session 中并且(在 pg 9.2 中+ 至少)只有在几次执行表明相同的查询计划重复运行效果最好之后。如果您怀疑这对您来说是错误的,您可以使用动态 SQL 解决它,它每次都会强制执行一个新计划:

EXECUTE 'SELECT function1()';

但是,我看到的最有可能的候选对象是导致劣质查询计划的无效统计信息。 SELECT/PERFORM 函数内的语句(相同的东西)快速连续运行,没有机会 autovacuum启动并更新一个函数与下一个函数之间的统计数据。如果一个函数大量改变了下一个函数正在处理的表中的数据,则下一个函数可能会根据过时的信息制定查询计划。典型示例:一个只有几行的表填满了数千行,但下一个计划仍然认为顺序扫描对于“小”表是最快的。你声明:

when I sum the time that each function takes by itself, the total is 200 seconds, while the time that the function process() takes is more than one hour!

“本身”是什么意思?究竟是什么意思?您是在单个事务中还是在单个事务中运行它们?也许中间有一段时间?这将允许 autovacuum 更新统计信息(通常相当快)并可能导致基于更改后的统计信息的完全不同的查询计划。

您可以使用 auto-explain 检查内部 plpgsql 函数的查询计划

如果您可以识别此类问题,则可以在语句之间强制使用 ANALYZE。就此而言,对于几个 SELECT/PERFORM 语句,您还不如使用更简单的 SQL 函数 并完全避免计划缓存(但是见下文!):

CREATE OR REPLACE FUNCTION process()
  RETURNS text
  LANGUAGE sql AS
$func$
   SELECT function1();

   ANALYZE some_substantially_affected_table;

   SELECT function2();
   SELECT function3();

   ANALYZE some_other_table;

   SELECT function4();
   SELECT 'process ended';  -- only last result is returned
$func$;

此外,只要我们看不到您所调用函数的实际代码,就可能存在任意数量的其他隐藏效果
示例:您可以SET LOCAL ... 一些配置参数来提高function1() 的性能。如果在单独的事务中调用,则不会影响其余部分。效果只持续到交易结束。但是,如果在单个事务中调用它,它也会影响其余部分......

基础知识:

另外:事务会累积锁,这会绑定(bind)越来越多的资源,并可能导致与并发进程的摩擦增加。所有锁都在事务结束时释放。最好在尽可能单独的事务 中运行大型函数,而不是将其封装在单个函数(以及事务)中。最后一项与什么有关 @klinIMSoP已经涵盖了。

关于postgresql - 在不损失性能的情况下同时执行多个功能,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/30351256/

相关文章:

java - 在 Java 中,调用 PostgreSQL 函数,为什么我收到错误消息,通知该函数不存在?

Mongodb:高获取数据库锁

java - Heroku - 致命 : password authentication failed for user <>

javascript - 仅从主查询中按顺序排列顺序

sql - 数组的 JSONB 子集

Postgresql:EXECUTE sql_cmd merge with CREATE TEMP TABLE temp_tbl AS SELECT

arrays - 如何循环遍历 JSONb 字段中包含的数组?

mongodb - 如何配置 MongoDB Java 驱动程序 MongoOptions 以供生产使用?

mysql - 为什么where子句中的大于会导致全表扫描?

Postgresql - 基本数组和 array_agg