求教,htmlparser遇到一个情况
python吧
全部回复
仅看楼主
level 1
韩寒 楼主
本人想在下面的这段html文档中截取日期和 BO, 可是我只能截取日期,BO出不来。我需要在网站上迭代截取9个日期和9个 BO,每个都是对应的,请问大神怎么获取数据?代码在2楼,网站在3楼。
<tr class="stockrow1">
<td nowrap>
Sept. 29, 2016
<font size="-1">
BO
</font>
</td>
2017年04月06日 08点04分 1
level 1
韩寒 楼主
不好意思,2楼的代码有点错,正确的在这里
# -*- coding: cp936 -*-
import pandas as pd
from HTMLParser import HTMLParser
import urllib2
html_code=urllib2.urlopen('https://www.optionslam.com/earnings/stocks/ACN').read()
class MyParser(HTMLParser):
re=[]
flg=0
def handle_starttag(self, tag, attrs):
if tag=='td':
for attr in attrs:
if attr[0]=="nowrap":
self.flg=1
break
else:
pass
def handle_data(self, data):
if self.flg==1:
self.re.append(data.strip())
self.flg=0
else:
pass
my=MyParser()
my.feed(html_code)
print my.re
2017年04月06日 08点04分 4
level 1
韩寒 楼主
2017年04月06日 08点04分 5
1