from bs4 import BeautifulSoup
for name in ('LPAC','SS','AEAT'):
with open('/tmp/'+name+'.html',encoding='utf8') as f:
text=BeautifulSoup(f,'html.parser').get_text(' ',strip=True)
with open('/tmp/'+name+'.txt','w',encoding='utf8') as f:
f.write(text)
print('\n===',name,'chars',len(text),'===')
if name=='LPAC':
for needle in ('Representación','Artículo 5','Artículo 6','Artículo 12','Artículo 14','Artículo 16'):
i=text.find(needle)
print('\n',needle,'at',i,'\n',text[i:i+2200])
else:
print(text[:4000])