一種比較省內存的稀疏矩陣Python存儲方案-Python教學-PHP中文網

首頁

後端開發

Python教學

一種比較省內存的稀疏矩陣Python存儲方案

高洛峰

Oct 18, 2016 am 09:54 AM

推薦系統中經常需要處理類似user_id, item_id, rating這樣的數據，其實就是數學裡面的稀疏矩陣，scipy中提供了sparse模組來解決這個問題，但scipy.sparse有很多問題不太合用：1、不能很好的同時支援data[i, ...]、data[..., j]、data[i, j]快速切片；2、由於資料保存在記憶體中，無法很好的支援海量資料處理。

要支援data[i, ...]、data[..., j]的快速切片，需要i或j的資料集中儲存；同時，為了保存海量的數據，也需要把資料的一部分放在硬碟上，用記憶體做buffer。這裡的解決方案比較簡單，用一個類Dict的東西來儲存數據，對於某個i（例如9527），它的數據保存在dict['i9527']裡面，同樣的，對於某個j（比如3306），它的全部資料都保存在dict['j3306']裡面，需要取出data[9527, ...]的時候，只要取出dict['i9527']即可，dict['i9527']原本是一個dict對象，儲存某個j對應的值，為了節省內存空間，我們把這個dict以二進製字符串形式存儲，直接上代碼：

&#39;&#39;&#39;
Sparse Matrix
&#39;&#39;&#39;
import struct
import numpy as np
import bsddb
from cStringIO import StringIO
  
class DictMatrix():
    def __init__(self, container = {}, dft = 0.0):
        self._data  = container
        self._dft   = dft
        self._nums  = 0
  
    def __setitem__(self, index, value):
        try:
            i, j = index
        except:
            raise IndexError(&#39;invalid index&#39;)
  
        ik = (&#39;i%d&#39; % i)
        # 为了节省内存，我们把j, value打包成字二进制字符串
        ib = struct.pack(&#39;if&#39;, j, value)
        jk = (&#39;j%d&#39; % j)
        jb = struct.pack(&#39;if&#39;, i, value)
  
        try:
            self._data[ik] += ib
        except:
            self._data[ik] = ib
        try:
            self._data[jk] += jb
        except:
            self._data[jk] = jb
        self._nums += 1
  
    def __getitem__(self, index):
        try:
            i, j = index
        except:
            raise IndexError(&#39;invalid index&#39;)
  
        if (isinstance(i, int)):
            ik = (&#39;i%d&#39; % i)
            if not self._data.has_key(ik): return self._dft
            ret = dict(np.fromstring(self._data[ik], dtype = &#39;i4,f4&#39;))
            if (isinstance(j, int)): return ret.get(j, self._dft)
  
        if (isinstance(j, int)):
            jk = (&#39;j%d&#39; % j)
            if not self._data.has_key(jk): return self._dft
            ret = dict(np.fromstring(self._data[jk], dtype = &#39;i4,f4&#39;))
  
        return ret
  
    def __len__(self):
        return self._nums
  
    def __iter__(self):
        pass
  
    &#39;&#39;&#39;
    从文件中生成matrix
    考虑到dbm读写的性能不如内存，我们做了一些缓存，每1000W次批量写入一次
    考虑到字符串拼接性能不太好，我们直接用StringIO来做拼接
    &#39;&#39;&#39;
    def from_file(self, fp, sep = &#39;t&#39;):
        cnt = 0
        cache = {}
        for l in fp:
            if 10000000 == cnt:
                self._flush(cache)
                cnt = 0
                cache = {}
            i, j, v = [float(i) for i in l.split(sep)]
  
            ik = (&#39;i%d&#39; % i)
            ib = struct.pack(&#39;if&#39;, j, v)
            jk = (&#39;j%d&#39; % j)
            jb = struct.pack(&#39;if&#39;, i, v)
  
            try:
                cache[ik].write(ib)
            except:
                cache[ik] = StringIO()
                cache[ik].write(ib)
  
            try:
                cache[jk].write(jb)
            except:
                cache[jk] = StringIO()
                cache[jk].write(jb)
  
            cnt += 1
            self._nums += 1
  
        self._flush(cache)
        return self._nums
  
    def _flush(self, cache):
        for k,v in cache.items():
            v.seek(0)
            s = v.read()
            try:
                self._data[k] += s
            except:
                self._data[k] = s
  
if __name__ == &#39;__main__&#39;:
    db = bsddb.btopen(None, cachesize = 268435456)
    data = DictMatrix(db)
    data.from_file(open(&#39;/path/to/log.txt&#39;, &#39;r&#39;), &#39;,&#39;)

測試4500W條rating數據（整形,整型,浮點格式），922MB文本檔導入，採用內存dict儲存的話，12分鐘構建完畢，消耗內存1.2G，採用示例代碼中的bdb存儲，20分鐘構建完畢，佔用內存300～400MB左右，比cachesize大不了多少，數據讀chesize大不了多少，數據讀chesize大不了多少，數據讀取測試：

import timeit
timeit.Timer(&#39;foo = __main__.data[9527, ...]&#39;, &#39;import __main__&#39;).timeit(number = 1000)

消耗1.4788秒，大概讀取一條資料1.5ms。

採用類Dict來儲存資料的另一個好處是你可以隨便用記憶體Dict或其他任何形式的DBM，甚至傳說中的Tokyo Cabinet….

好的，碼完收工。

陳述

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

您如何切成python列表？May 02, 2025 am 12:14 AM

SlicingaPythonlistisdoneusingthesyntaxlist[start:stop:step].Here'showitworks:1)Startistheindexofthefirstelementtoinclude.2)Stopistheindexofthefirstelementtoexclude.3)Stepistheincrementbetweenelements.It'susefulforextractingportionsoflistsandcanuseneg

在Numpy陣列上可以執行哪些常見操作？May 02, 2025 am 12:09 AM

numpyallowsforvariousoperationsonArrays：1）basicarithmeticlikeaddition，減法，乘法和division; 2）evationAperationssuchasmatrixmultiplication; 3）element-wiseOperations wiseOperationswithOutexpliitloops; 4）

Python的數據分析中如何使用陣列？May 02, 2025 am 12:09 AM

Arresinpython，尤其是Throughnumpyandpandas，weessentialFordataAnalysis，offeringSpeedAndeffied.1）NumpyArseNable efflaysenable efficefliceHandlingAtaSetSetSetSetSetSetSetSetSetSetSetsetSetSetSetSetsopplexoperationslikemovingaverages.2）

列表的內存足跡與python數組的內存足跡相比如何？May 02, 2025 am 12:08 AM

列表sandnumpyArraysInpythonHavedIfferentMemoryfootprints：listSaremoreFlexibleButlessMemory-效率，而alenumpyArraySareSareOptimizedFornumericalData.1）listsStorReereReereReereReereFerenceStoObjects，with withOverHeadeBheadaroundAroundaround64byty64-bitsysysysysysysysysyssyssyssyssysssyssys2）

部署可執行的Python腳本時，如何處理特定環境的配置？May 02, 2025 am 12:07 AM

toensurepythonscriptsbehavecorrectlyacrycrosdevelvermations，分期和生產，USETHESTERTATE：1）Environment varriablesForsimplesettings，2）configurationfilesfilesForcomPlexSetups，3）dynamiCofforComplexSetups，dynamiqualloadingForaptaptibality.eachmethodoffersuniquebeneiquebeneqeniquebenefitsandrefitsandrequiresandrequiresandrequiresca

您如何切成python陣列？May 01, 2025 am 12:18 AM

Python列表切片的基本語法是list[start:stop:step]。 1.start是包含的第一個元素索引，2.stop是排除的第一個元素索引，3.step決定元素之間的步長。切片不僅用於提取數據，還可以修改和反轉列表。

在什麼情況下，列表的表現比數組表現更好？May 01, 2025 am 12:06 AM

ListSoutPerformarRaysin：1）DynamicsizicsizingandFrequentInsertions/刪除，2）儲存的二聚體和3）MemoryFeliceFiceForceforseforsparsedata，butmayhaveslightperformancecostsinclentoperations。

如何將Python數組轉換為Python列表？May 01, 2025 am 12:05 AM

toConvertapythonarraytoalist，usEthelist（）constructororageneratorexpression.1）intimpthearraymoduleandcreateanArray.2）USELIST（ARR）或[XFORXINARR] to ConconverTittoalist，請考慮performorefformanceandmemoryfformanceandmemoryfformienceforlargedAtasetset。

See all articles