sql海量資料優化 @ 自由手記

具體要注意的：

1.應儘量避免在 where 子句中對欄位進行 null 值判斷，否則將導致引擎放棄使用索引而進行全資料表掃描，如：

select id from t where num is null

可以在num上設置預設值0，確保表中num列沒有null值，然後這樣查詢：

select id from t where num=0

2.應儘量避免在 where 子句中使用!=或<>操作符，否則將引擎放棄使用索引而進行全資料表掃描。優化器將無法通過索引來確定將要命中的行數,因此需要搜索該表的所有行。

3.應儘量避免在 where 子句中使用 or 來連接條件，否則將導致引擎放棄使用索引而進行全資料表掃描，如：

select id from t where num=10 or num=20

可以這樣查詢：

select id from t where num=10

union all

select id from t where num=20

4.in 和 not in 也要慎用，因為IN會使系統無法使用索引,而只能直接搜索表中的資料。如：

select id from t where num in(1,2,3)

對於連續的數值，能用 between 就不要用 in 了：

select id from t where num between 1 and 3

5.儘量避免在索引過的字元資料中，使用非打頭字母搜索。這也使得引擎無法利用索引。

見如下例子：

SELECT * FROM T1 WHERE NAME LIKE ‘%L%’

SELECT * FROM T1 WHERE SUBSTING(NAME,2,1)=’L’

SELECT * FROM T1 WHERE NAME LIKE ‘L%’

即使NAME欄位建有索引，前兩個查詢依然無法利用索引完成加快操作，引擎不得不對全表所有資料逐條操作來完成任務。而第三個查詢能夠使用索引來加快操作。

6.必要時強制查詢最佳化工具使用某個索引，如在 where 子句中使用參數，也會導致全資料表掃描。因為SQL只有在運行時才會解析區域變數，但優化程式不能將訪問計畫的選擇推遲到運行時；它必須在編譯時進行選擇。然而，如果在編譯時建立訪問計畫，變數的值還是未知的，因而無法作為索引選擇的輸入項。如下面語句將進行全資料表掃描：

select id from t where num=@num

可以改為強制查詢使用索引：

select id from t with(index(索引名)) where num=@num

7.應儘量避免在 where 子句中對欄位進行運算式操作，這將導致引擎放棄使用索引而進行全資料表掃描。如：

SELECT * FROM T1 WHERE F1/2=100

應改為:

SELECT * FROM T1 WHERE F1=100*2

SELECT * FROM RECORD WHERE SUBSTRING(CARD_NO,1,4)=’5378’

應改為:

SELECT * FROM RECORD WHERE CARD_NO LIKE ‘5378%’

SELECT member_number, first_name, last_name FROM members

WHERE DATEDIFF(yy,datofbirth,GETDATE()) > 21

應改為:

SELECT member_number, first_name, last_name FROM members

WHERE dateofbirth < DATEADD(yy,-21,GETDATE())

即：任何對列的操作都將導致資料表掃描，它包括資料庫函數、計算運算式等等，查詢時要盡可能將操作移至等號右邊。

8.應儘量避免在where子句中對欄位進行函數操作，這將導致引擎放棄使用索引而進行全資料表掃描。如：

select id from t where substring(name,1,3)='abc'--name以abc開頭的id

select id from t where datediff(day,createdate,'2005-11-30')=0--‘2005-11-30’生成的id

應改為:

select id from t where name like 'abc%'

select id from t where createdate>='2005-11-30' and createdate<'2005-12-1'

9.不要在 where 子句中的「=」左邊進行函數、算數運算或其他運算式運算，否則系統將可能無法正確使用索引。

10.在使用索引欄位作為條件時，如果該索引是複合索引，那麼必須使用到該索引中的第一個欄位作為條件時才能保證系統使用該索引，否則該索引將不會被使用，並且應盡可能的讓欄位順序與索引順序相一致。

11.很多時候用 exists是一個好的選擇：

select num from a where num in(select num from b)

用下面的語句替換：

select num from a where exists(select 1 from b where num=a.num)

SELECT SUM(T1.C1)FROM T1 WHERE(

(SELECT COUNT(*)FROM T2 WHERE T2.C2=T1.C2>0)

SELECT SUM(T1.C1) FROM T1WHERE EXISTS(

SELECT * FROM T2 WHERE T2.C2=T1.C2)

兩者產生相同的結果，但是後者的效率顯然要高於前者。因為後者不會產生大量鎖定的資料表掃描或是索引掃描。

如果你想校驗表裡是否存在某條紀錄，不要用count(*)那樣效率很低，而且浪費伺服器資源。可以用EXISTS代替。如：

IF (SELECT COUNT(*) FROM table_name WHERE column_name = 'xxx')

可以寫成：

IF EXISTS (SELECT * FROM table_name WHERE column_name = 'xxx')

經常需要寫一個T_SQL語句比較一個父結果集和子結果集，從而找到是否存在在父結果集中有而在子結果集中沒有的記錄，如：

SELECT a.hdr_key FROM hdr_tbl a---- tbl a 表示tbl用別名a代替

WHERE NOT EXISTS (SELECT * FROM dtl_tbl b WHERE a.hdr_key = b.hdr_key)

SELECT a.hdr_key FROM hdr_tbl a

LEFT JOIN dtl_tbl b ON a.hdr_key = b.hdr_key WHERE b.hdr_key IS Null

SELECT hdr_key FROM hdr_tbl

WHERE hdr_key NOT IN (SELECT hdr_key FROM dtl_tbl)

三種寫法都可以得到同樣正確的結果，但是效率依次降低。

12.儘量使用表變數來代替臨時表。如果表變數包含大量資料，請注意索引非常有限（只有主鍵索引）。

13.避免頻繁創建和刪除臨時表，以減少系統表資源的消耗。

14.臨時表並不是不可使用，適當地使用它們可以使某些常式更有效，例如，當需要重複引用大型表或常用表中的某個資料集時。但是，對於一次性事件，最好使用匯出表。

15.在新建臨時表時，如果一次性插入資料量很大，那麼可以使用 select into 代替 create table，避免造成大量 log ，以提高速度；如果資料量不大，為了緩和系統表的資源，應先create table，然後insert。

16.如果使用到了臨時表，在預存程序的最後務必將所有的臨時表顯式刪除，先 truncate table ，然後 drop table ，這樣可以避免系統表的較長時間鎖定。

17.在所有的預存程序和觸發器的開始處設置 SET NOCOUNT ON ，在結束時設置 SET NOCOUNT OFF 。無需在執行預存程序和觸發器的每個語句後向用戶端發送 DONE_IN_PROC 消息。

18.儘量避免大事務操作，提高系統併發能力。

19.儘量避免向用戶端返回大資料量，若資料量過大，應該考慮相應需求是否合理。

20. 避免使用不相容的資料類型。例如float和int、char和Varchar、binary和Varbinary是不相容的。資料類型的不相容可能使優化器無法執行一些本來可以進行的優化操作。例如:

SELECT name FROM employee WHERE salary > 60000

在這條語句中,如salary欄位是money型的,則優化器很難對其進行優化,因為60000是個整型數。我們應當在程式設計時將整型轉化成為錢幣型,而不要等到運行時轉化。

21.充分利用連接條件，在某種情況下，兩個表之間可能不只一個的連接條件，這時在 WHERE 子句中將連接條件完整的寫上，有可能大大提高查詢速度。

例：

SELECT SUM(A.AMOUNT) FROM ACCOUNT A,CARD B WHERE A.CARD_NO = B.CARD_NO

SELECT SUM(A.AMOUNT) FROM ACCOUNT A,CARD B WHERE A.CARD_NO = B.CARD_NO AND A.ACCOUNT_NO=B.ACCOUNT_NO

第二句將比第一句執行快得多。

22、使用視圖加速查詢

把表的一個子集進行排序並創建視圖，有時能加速查詢。它有助於避免多重排序操作，而且在其他方面還能簡化優化器的工作。例如：

SELECT cust.name，rcvbles.balance，......other columns

FROM cust，rcvbles

WHERE cust.customer_id = rcvlbes.customer_id

AND rcvblls.balance>0

AND cust.postcode>「98000」

ORDER BY cust.name

如果這個查詢要被執行多次而不止一次，可以把所有未付款的客戶找出來放在一個視圖中，並按客戶的名字進行排序：

CREATE VIEW DBO.V_CUST_RCVLBES

SELECT cust.name，rcvbles.balance，......other columns

FROM cust，rcvbles

WHERE cust.customer_id = rcvlbes.customer_id

AND rcvblls.balance>0

ORDER BY cust.name

然後以下面的方式在視圖中查詢：

SELECT ＊ FROM V_CUST_RCVLBES

WHERE postcode>「98000」

視圖中的行要比主表中的行少，而且物理順序就是所要求的順序，減少了磁片I/O，所以查詢工作量可以得到大幅減少。

23、能用DISTINCT的就不用GROUP BY

SELECT OrderID FROM Details WHERE UnitPrice > 10 GROUP BY OrderID

可改為：

SELECT DISTINCT OrderID FROM Details WHERE UnitPrice > 10

24.能用UNION ALL就不要用UNION

UNION ALL不執行SELECT DISTINCT函數，這樣就會減少很多不必要的資源

35.儘量不要用SELECT INTO語句。

SELECT INOT 語句會導致表鎖定，阻止其他使用者訪問該表。

上面我們提到的是一些基本的提高查詢速度的注意事項,但是在更多的情況下,往往需要反復試驗比較不同的語句以得到最佳方案。最好的方法當然是測試，看實現相同功能的SQL語句哪個執行時間最少，但是資料庫中如果資料量很少，是比較不出來的，這時可以用查看執行計畫，即：把實現相同功能的多條SQL語句考到查詢分析器，按CTRL+L看查所利用的索引，資料表掃描次數（這兩個對性能影響最大），總體上看詢成本百分比即可。

今天在itput上看了一篇文章，是討論一個語句的優化：

原貼位址： HTTP://www.itpub.net/viewthread.php?tid=1015964&extra=&page=1

一，發現問題優化的語句：

請問以下語句如何優化:

CREATE TABLE aa_001

( ip VARCHAR2(28),

name VARCHAR2(10),

password VARCHAR2(30) )

select * from aa_001 where ip in (1,2,3) order by name desc;

--目前表中記錄有一千多萬條左右，而且in中的值個數是不確定的。

以上就是優化的需要優化的語句和情況。

不少人在後面跟帖：有的說沒辦法優化，有的說將ＩＮ該為ＥＸＩＳＴＳ，有的說在ip上建立索引複合索引（ip，name)等等。

二，提出問題那這樣的情況，能優化嗎，如何優化？今天就來討論這個問題。

三，分析問題 1，資料量1千萬多條。

2，in中的值個數是不確定

3.1 分析資料分佈這裡作者沒有提到ip列的資料的分佈情況，目前ip列的資料分佈可能有以下幾種：

1，ip列（資料唯一，或者資料重複的概率很小）

2，ip列 (資料不均勻，可能有些資料重複多，有些重複少）

3，ip列（資料分佈比較均勻，資料大量重複，主要就是一些同樣的資料（可能只有上萬級別不同的ip資料等)

解決問題：

1，對於第一種資料分佈情況，只要在ip列建立一個索引即可。這時不管表有多少行， in個數是不確定的情況下，都很快。

2，對應第二中資料分佈情況，在ip列建立索引，效果不好。因為資料分佈不均勻，可能有些快，有些慢

3，對應第三種資料分佈情況，在ip列建立索引，速度肯定慢。

注意：這裡的 order by name desc 是在取出資料後再排序的。而不是取資料前排序

對於2，3兩個情況，因為都是可能需要取出大量的資料，優化器就採用資料表掃描(table scan)，而不是索引查找(index seek) ,速度很慢，因為這時資料表掃描效率要優於索引查找，特別是高併發情況下，效率很低。

那對應2，3中情況，如何處理。是將in改成exists。其實在sql server 2005和oracle裡的優化器在in後面資料少時，效率是一樣的。這時採用一般的索引效率很低。這時如果在ip列上建立叢集索引，效率會比較高。我們在SQL server 2005中做個測試。

表：[dbo].[[zping.com]]]中有約200萬條資料。包含列Userid, id, Ruleid等列。按照上面的情況查詢一下類似語句：

select * from [dbo].[[zping.com]]] where

userid in ('402881410ca47925010cb329c7670ffb','402881ba0d5dc94e010d5dced05a0008'

,'4028814111a735e90111a77fa8e30384') order by Ruleid desc

我們先看userid的資料分佈情況，執行下面語句：

select userid,count(*) from [dbo].[[zping.com]]] group by userid order by 2

這時我們看看資料分佈：總共有379條資料，資料兩從1到15萬都有，資料分佈傾斜嚴重。下圖是其中一部分。

這時如果在ip上建立非叢集索引，效率很低，而且就是強行索引掃描，效率也很低，會發現IO次數比資料表掃描還高。這時只能在ip上建立叢集索引。這時看看結果。

這時發現，搜索採用了（clustered index seek）聚集搜索掃描。

在看看查詢返回的結果：

(156603 行受影響)

表 '[zping.com]'。掃描計數 8，邏輯讀取 5877 次，物理讀取 0 次，預讀 0 次，lob 邏輯讀取 0 次，lob 物理讀取 0 次，lob 預讀 0 次。

表 'Worktable'。掃描計數 0，邏輯讀取 0 次，物理讀取 0 次，預讀 0 次，lob 邏輯讀取 0 次，lob 物理讀取 0 次，lob 預讀 0 次。

返回15萬行，才不到6千次IO。效率較高，因為這15萬行要排序，查詢成本裡排序占了51%。當然可以建立（userid，Ruleid）複合叢集索引，提高性能，但這樣做DML維護成本較高。建議不採用。

從上面的測試例子可以看出，優化的解決辦法：

資料分佈為1：建立ip索引即可

資料分佈為2，3：在ip列建立叢集索引。

戮克

自由手記

戮克發表在痞客邦留言(0) 人氣()

E-mail轉寄

自由手記

記錄區

sql海量資料優化

歷史上的今天

留言列表

站方公告

活動快報

痞客邦...

我的好友

熱門文章

最新文章

動態訂閱

文章精選

文章搜尋

新聞交換(RSS)

誰來我家

POWERED BY

RSS訂閱

參觀人氣

最新留言

我的連結

月曆

我去誰家

QR Code

«	四月 2024					»
日	一	二	三	四	五	六
	1	2	3	4	5	6
7	8	9	10	11	12	13
14	15	16	17	18	19	20
21	22	23	24	25	26	27
28	29	30

«	四月 2024					»
日	一	二	三	四	五	六
	1	2	3	4	5	6
7	8	9	10	11	12	13
14	15	16	17	18	19	20
21	22	23	24	25	26	27
28	29	30

«	四月 2024					»
日	一	二	三	四	五	六
	1	2	3	4	5	6
7	8	9	10	11	12	13
14	15	16	17	18	19	20
21	22	23	24	25	26	27
28	29	30