Explorer
/proc/self/task/1527770/root/tmp/extract_sources.py
← Zurück ↓ Download
from bs4 import BeautifulSoup
for name in ('LPAC','SS','AEAT'):
    with open('/tmp/'+name+'.html',encoding='utf8') as f:
        text=BeautifulSoup(f,'html.parser').get_text(' ',strip=True)
    with open('/tmp/'+name+'.txt','w',encoding='utf8') as f:
        f.write(text)
    print('\n===',name,'chars',len(text),'===')
    if name=='LPAC':
        for needle in ('Representación','Artículo 5','Artículo 6','Artículo 12','Artículo 14','Artículo 16'):
            i=text.find(needle)
            print('\n',needle,'at',i,'\n',text[i:i+2200])
    else:
        print(text[:4000])