PostgreSQL利用递归优化求稀疏列唯一值的方法

SEO优化专员 • 2025年1月3日 23:34:57 • 数据库 • 阅读 2

在数据库中经常会碰到一些表的列是稀疏列，只有很少的值，例如性别字段，一般就只有2种不同的值。

但是当我们求这些稀疏列的唯一值时，如果表的数据量很大，速度还是会很慢。

例如：

创建测试表

bill=# create table t_sex (sex char(1), otherinfo text);
CREATE TABLE
bill=# insert into t_sex select ‘m’, generate_series(1,10000000)||’this is test’;
INSERT 0 10000000
bill=# insert into t_sex select ‘w’, generate_series(1,10000000)||’this is test’;
INSERT 0 10000000

查询：

可以看到下面的查询速度很慢。

bill=# select count(distinct sex) from t_sex;
count
——-
2
(1 row)

Time: 8803.505 ms (00:08.804)
bill=# select sex from t_sex t group by sex;
sex
—–
m
w
(2 rows)

Time: 1026.464 ms (00:01.026)

那么我们对该字段加上索引又是什么情况呢？

速度依然没有明显

bill=# create index idx_sex_1 on t_sex(sex);
CREATE INDEX
bill=# select count(distinct sex) from t_sex;
count
——-
2
(1 row)

Time: 8502.460 ms (00:08.502)
bill=# select sex from t_sex t group by sex;
sex
—–
m
w
(2 rows)

Time: 572.353 ms

的变化，可以看到执行计划已经使用Index Only Scan了。

bill=# explain select count(distinct sex) from t_sex;
QUERY PLAN
———————————————————————————————-
Aggregate (cost=371996.44..371996.45 rows=1 width=8)
-> Index Only Scan using idx_sex_1 on t_sex (cost=0.44..321996.44 rows=20000000 width=2)
(2 rows)

同样的SQL我们看看在Oracle中性能如何？

创建测试表：

SQL> create table t_sex (sex char(1), otherinfo varchar2(100));

Table created.

SQL> insert into t_sex select ‘m’, rownum||’this is test’ from dual connect by level <=10000000;

10000000 rows created.

SQL> commit;

Commit complete.

SQL> insert into t_sex select ‘w’, rownum||’this is test’ from dual connect by level <=10000000;

10000000 rows created.

SQL> commit;

Commit complete.

性能测试：

SQL> set lines 1000 pages 2000
SQL> set autotrace on
SQL> set timing on

SQL> select count(distinct sex) from t_sex;

COUNT(DISTINCTSEX)
——————
2

Elapsed: 00:00:01.58

Execution Plan
———————————————————-
Plan hash value: 3915432945

—————————————————————————-
| Id | Operation     | Name | Rows | Bytes | Cost (%CPU)| Time   |
—————————————————————————-
| 0 | SELECT STATEMENT |    |   1 |   3 | 20132 (1)| 00:00:01 |
| 1 | SORT GROUP BY   |    |   1 |   3 |      |     |
| 2 | TABLE ACCESS FULL| T_SEX | 14M| 42M| 20132 (1)| 00:00:01 |
—————————————————————————-

Note
—–
– dynamic statistics used: dynamic sampling (level=2)

Statistics
———————————————————-
     0 recursive calls
     0 db block gets
   74074 consistent gets
     0 physical reads
     0 redo size
    552 bytes sent via SQL*Net to client
    608 bytes received via SQL*Net from client
     2 SQL*Net roundtrips to/from client
     1 sorts (memory)
     0 sorts (disk)
     1 rows processed

SQL> select sex from t_sex t group by sex;

SE
—
m
w

Elapsed: 00:00:01.08

Execution Plan
———————————————————-
Plan hash value: 3915432945

—————————————————————————-
| Id | Operation     | Name | Rows | Bytes | Cost (%CPU)| Time   |
—————————————————————————-
| 0 | SELECT STATEMENT |    | 14M| 42M| 20558 (3)| 00:00:01 |
| 1 | SORT GROUP BY   |    | 14M| 42M| 20558 (3)| 00:00:01 |
| 2 | TABLE ACCESS FULL| T_SEX | 14M| 42M| 20132 (1)| 00:00:01 |
—————————————————————————-

Note
—–
– dynamic statistics used: dynamic sampling (level=2)

Statistics
———————————————————-
     0 recursive calls
     0 db block gets
   74074 consistent gets
     0 physical reads
     0 redo size
    589 bytes sent via SQL*Net to client
    608 bytes received via SQL*Net from client
     2 SQL*Net roundtrips to/from client
     1 sorts (memory)
     0 sorts (disk)
     2 rows processed

可以看到Oracle的性能即使不加索引也明显比PostgreSQL中要好。

那么我们在PostgreSQL中是不是没办法继续优化了呢？这种情况我们利用pg中的递归语句结合索引可以大幅提升性能。

SQL改写：

bill=# with recursive tmp as (
bill(# (
bill(#   select min(t.sex) as sex from t_sex t where t.sex is not null
bill(# )
bill(# union all
bill(# (
bill(#   select (select min(t.sex) from t_sex t where t.sex > s.sex and t.sex is not null)
bill(#    from tmp s where s.sex is not null
bill(# )
bill(# )
bill-# select count(distinct sex) from tmp;
count
——-
   2
(1 row)

Time: 2.711 ms

查看执行计划：

bill=# explain with recursive tmp as (
bill(# (
bill(#   select min(t.sex) as sex from t_sex t where t.sex is not null
bill(# )
bill(# union all
bill(# (
bill(#   select (select min(t.sex) from t_sex t where t.sex > s.sex and t.sex is not null)
bill(#    from tmp s where s.sex is not null
bill(# )
bill(# )
bill-# select count(distinct sex) from tmp;
                           QUERY PLAN
———————————————————————————————————————-
Aggregate (cost=53.62..53.63 rows=1 width=8)
CTE tmp
   -> Recursive Union (cost=0.46..51.35 rows=101 width=32)
      -> Result (cost=0.46..0.47 rows=1 width=32)
         InitPlan 3 (returns $1)
          -> Limit (cost=0.44..0.46 rows=1 width=2)
             -> Index Only Scan using idx_sex_1 on t_sex t (cost=0.44..371996.44 rows=20000000 width=2)
                Index Cond: (sex IS NOT NULL)
      -> WorkTable Scan on tmp s (cost=0.00..4.89 rows=10 width=32)
         Filter: (sex IS NOT NULL)
-> CTE Scan on tmp (cost=0.00..2.02 rows=101 width=32)
(11 rows)

Time: 1.371 ms

可以看到执行时间从原先的8000ms降低到了2ms，提升了几千倍！

甚至对比Oracle，性能也是提升了很多。

但是需要注意的是：这种写法仅仅是针对稀疏列，换成数据分布广泛的字段，显然性能是下降的, 所以使用递归SQL不适合数据分布广泛的字段的group by或者count(distinct)操作。

文章来源：脚本之家

来源地址：https://www.jb51.net/article/204437.htm

发布者：SEO优化专员，转转请注明出处：https://www.chuangxiangniao.com/p/892222.html

0 0

关于作者

SEO优化专员签约作者

34.1K 文章

0 评论

0 粉丝

这个人很懒，什么都没有留下～

Visual Studio Code(VS Code)查询PostgreSQL拓展安装教程图解

上一篇 2025年1月3日 23:34:42

浅析postgresql 数据库 TimescaleDB 修改分区时间范围

下一篇 2025年1月3日 23:35:15

SQLite 中文指南之FAQ第1/6页

sqllite使用过程中碰到的一些问题解决，中文版 1. 如何创建自增字段？ 2. SQLite 支持哪些数据类型？ 3. 为什么能向 SQLite 数据库的整型字段中插入字符串？ 4. 为什么 SQLite 认为表达式 ‘0&…

SEO优化专员
数据库 2025年1月4日
1000
Access创建一个简单MIS管理系统

所谓MIS管理系统，是一个由人、计算机及其他外围设备等组成的能进行信息的收集、传递、存贮、加工、维护和使用的系统。MIS管理系统是一种新兴的技术，那么下文中就给大家介绍Access这个有历史的数据库系统如何创建一个简单的MIS管理系统。 M…

SEO优化专员
数据库 2025年1月4日
1000
读取注册表根据Office版本获取数据库连接字段

本节主要介绍了如何根据Office版本获取数据库连接字段，以读取注册表获取Office版本，实现代码如下，感兴趣的朋友不要错过 /// /// 读取注册表，根据Office版本获取数据库连接字段 /// /// 数据库连接字段 privat…

SEO优化专员
数据库 2025年1月4日
1000
数据库

PostgreSQL操作符实践技巧分享

这篇文章主要给大家介绍了关于PostgreSQL基础知识之SQL操作符实践的相关资料，文中通过示例代码介绍的非常详细，对大家学习或者使用PostgreSQL具有一定的参考学习价值，需要的朋友们下面来一起学习学习吧前言操作符是数据库具有的…

SEO优化专员
2025年1月4日
1000
数据库

SQL Server如何通过创建临时表遍历更新数据详解

这篇文章主要给大家介绍了关于SQL Server如何通过创建临时表遍历更新数据的相关资料，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧前言：前段时间新项目上线为了赶…

SEO优化专员
2025年1月4日
1000
Mac系统重置PostgreSQL密码技巧及代码展示

PostgreSQL 是一个免费的对象-关系数据库服务器(ORDBMS)，在灵活的BSD许可证下发行。这篇文章主要介绍了Mac系统重置PostgreSQL密码的方法示例代码,需要的朋友可以参考下 PostgreSQL是一种特性非常齐全的自由…

SEO优化专员
数据库 2025年1月4日
1000
数据库

PostgreSQL技巧分享：图(graph）的递归查询实例

这篇文章主要给大家介绍了关于PostgreSQL图(graph）的递归查询的相关资料，文中通过示例代码介绍的非常详细，对大家学习或者使用PostgreSQL具有一定的参考学习价值，需要的朋友们下面来一起学习学习吧背景在树形递归查询这篇文…

SEO优化专员
2025年1月4日
1000
PostgreSQL技巧如何获取当前日期时间

这篇文章主要介绍了PostgreSQL 如何获取当前日期时间及注意事项，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧在开发数据库应用或者调试代码时，经常需要获取系统的…

SEO优化专员
数据库 2025年1月4日
1000
数据库

postgresql中的ltree类型使用技巧

这篇文章主要给大家介绍了关于postgresql中ltree类型使用的相关资料，文中通过示例代码介绍的非常详细，对大家学习或者使用postgresql具有一定的参考学习价值，需要的朋友们下面来一起学习学习吧 postgresql有很多比较妖…

SEO优化专员
2025年1月4日
1000
MongoDB通配符索引的用法实例

这篇文章主要给大家介绍了关于MongoDB通配符索引的相关资料，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧指南 MongoDB在4.2 版本推出了Wildcard …

SEO优化专员
数据库 2025年1月4日
1000

发表回复

登录后才能评论

PostgreSQL利用递归优化求稀疏列唯一值的方法

关于作者

SEO优化专员签约作者

发表回复

联系我们

156-6553-5169

PostgreSQL利用递归优化求稀疏列唯一值的方法

关于作者

AD推荐 黄金广告位招租... 更多推荐

相关推荐

发表回复

联系我们

156-6553-5169

AD推荐黄金广告位招租... 更多推荐