Ho un file enorme di 3.000.000 di righe e ogni riga contiene 20-40 parole. Devo estrarre da 1 a 5 ngram dal corpo. I miei file di input vengono tokenized testo normale, ad esempio:Estrazione efficace da 1-5 grammi con pitone
This is a foo bar sentence .
There is a comma , in this sentence .
Such is an example text .
Attualmente, sto facendo come qui sotto, ma questo non sembra essere un modo efficace per estrarre i 1-5grams:
#!/usr/bin/env python -*- coding: utf-8 -*-
import io, os
from collections import Counter
import sys; reload(sys); sys.setdefaultencoding('utf-8')
with io.open('train-1.tok.en', 'r', encoding='utf8') as srcfin, \
io.open('train-1.tok.jp', 'r', encoding='utf8') as trgfin:
# Extract words from file.
src_words = ['<s>'] + srcfin.read().replace('\n', ' </s> <s> ').split()
del src_words[-1] # Removes the final '<s>'
trg_words = ['<s>'] + trgfin.read().replace('\n', ' </s> <s> ').split()
del trg_words[-1] # Removes the final '<s>'
# Unigrams count.
src_unigrams = Counter(src_words)
trg_unigrams = Counter(trg_words)
# Sum of unigram counts.
src_sum_unigrams = sum(src_unigrams.values())
trg_sum_unigrams = sum(trg_unigrams.values())
# Bigrams count.
src_bigrams = Counter(zip(src_words,src_words[1:]))
trg_bigrams = Counter(zip(trg_words,trg_words[1:]))
# Sum of bigram counts.
src_sum_bigrams = sum(src_bigrams.values())
trg_sum_bigrams = sum(trg_bigrams.values())
# Trigrams count.
src_trigrams = Counter(zip(src_words,src_words[1:], src_words[2:]))
trg_trigrams = Counter(zip(trg_words,trg_words[1:], trg_words[2:]))
# Sum of trigram counts.
src_sum_trigrams = sum(src_bigrams.values())
trg_sum_trigrams = sum(trg_bigrams.values())
C'è qualche altro modo per farlo in modo più efficiente?
Come estrarre in modo ottimale N Ngram diversi contemporaneamente?
Da Fast/Optimize N-gram implementations in python, essenzialmente questo:
zip(*[words[i:] for i in range(n)])
quando hard-coded è questo per bigrammi, n=2
:
zip(src_words,src_words[1:])
ed è questo per trigrammi, n=3
:
zip(src_words,src_words[1:],src_words[2:])
Qual è il formato dei file di input? – mbatchkarov