- android - 多次调用 OnPrimaryClipChangedListener
- android - 无法更新 RecyclerView 中的 TextView 字段
- android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0
- android - 使用 AppCompat 时,我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色
我正在使用 scrapy 抓取网站。一切都工作得很好,直到我遇到了这个关于几个值的特殊问题。
这是我获取值的方法
hxs.select("//table[@class='bodypad']//table/tr[1]/td//tr[10]//td[2]/text()").extract()[0].strip()
以下是输出
u'Rs.\xa05,000\n\r\n\t\t\t\t\t / -'
我还可以看到 strip() 方法也不适用于该值。以下是我的代码部分,该代码运行良好
hxs.select("//table[@class='bodypad']//table/tr[1]/td//tr[10]//td[2]/text()").extract()[2]
输出:
u'Rs. 1,000'
当我使用 .encode('ascii') 时,我得到了我所需要的:
'Rs. 1,000'
您能否建议我如何获得第一个值,在网站上它看起来像卢比。 5,000/-
。我想要得到类似的东西,而且 .encode('ascii') 不适用于第一个值。
编辑 - 示例 HTML 输入
<table width="100%" cellpadding="0" cellspacing="1" bgcolor="#CCCCCC">
<tbody><tr class="table_bdrow1_style">
<td width="40%" class="table_header_style"><b>Minimum Initial Investment</b></td>
<td class="table_bdtext_style">
Rs. 5,000
/ -
</td>
</tr>
<tr class="table_bdrow1_style">
<td width="40%" class="table_header_style"><b>Minimum Subsequent Investment</b></td>
<td class="table_bdtext_style">
Rs. 1,000
/ -
</td>
</tr>
<!--
<tr class="table_bdrow1_style">
<td width="40%" class=table_header_style><b>Minimum RSP Investment</b></td>
-->
<!--<td class=table_bdtext_style width="55%">-</td>-->
<!--
<td class=table_bdtext_style>-</td>
</tr>
-->
<tr class="table_bdrow1_style">
<td width="40%" class="table_header_style"><b>Minimum Redemption Amount</b></td>
<td class="table_bdtext_style">Rs. 1,000</td>
</tr>
<!--
<tr class="table_bdrow1_style">
<td width="40%" class=table_header_style valign="top"><b>Minimum Holding</b></td>
<td class=table_bdtext_style>-
</td>
</tr>
<tr class="table_bdrow1_style">
<td width="40%" class=table_header_style><b>Cooling-off Period</b></td>
<td class=table_bdtext_style>-</td>
</tr>
-->
<tr class="table_bdrow1_style">
<td width="40%" class="table_header_style"><b>Minimum Holding Period</b></td>
<td class="table_bdtext_style">-</td>
</tr>
<tr class="table_bdrow1_style">
<td width="40%" class="table_header_style"><b>Transaction Time for Redemption</b></td>
<td class="table_bdtext_style">1:50 PM</td>
</tr>
<tr class="table_bdrow1_style">
<td width="40%" class="table_header_style"><b>Entry Load</b></td>
<td class="table_bdtext_style">-</td>
</tr>
<tr class="table_bdrow1_style">
<td width="40%" class="table_header_style"><b>Exit Load</b></td>
<td class="table_bdtext_style">0.25% if the investments is redeemed / switched out within 1 month form the date of allotment
</td>
</tr>
</tbody></table>`
最佳答案
\xa0
是 Non-breaking space它在网页中显示为一个简单的空间。代码是否为 A0
,超出 ASCII 范围 (0-127):
Python 2.7.6 (default, Mar 22 2014, 22:59:56)
>>> u'Rs.\xa05,000\n\r\n\t\t\t\t\t / -'.encode()
Traceback (most recent call last):
File "<stdin>", line 1, in <module>
UnicodeEncodeError: 'ascii' codec can't encode character u'\xa0' in position 3: ordinal not in range(128)
因此,在将其编码为 ASCII 之前,您必须手动将其替换为简单的空格。
默认str.strip
仅去除空格,因此您应该手动去除字符 /-
。
这应该有效:
>>> u'Rs.\xa05,000\n\r\n\t\t\t\t\t / -'.replace(u'\xa0', u' ').encode().rstrip('-/ ').strip()
'Rs. 5,000'
>>>
关于python - 爬取: Unable to parse data into a human readable value,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/23406452/
我正在尝试使用 flot 绘制 SQL 数据库中的数据图表,这是使用 php 收集的,然后使用 json 编码的。 目前看起来像: [{"month":"February","data":482},
我有一个来自 php 行的 json 结果,类似于 ["value"]["value"] 我尝试使用内爆函数,但得到的结果是“value”“value” |id_kategori|created_at
脚本 1 将记录 two 但浏览器仍会将 select 元素呈现为 One。该表单还将提交值 one。 脚本 2 将记录、呈现和提交 两个。我希望它们是同义词并做同样的事情。请解释它们为何不同,以及我
我的python字典结构是这样的: ips[host][ip] 每行 ips[host][ip] 看起来像这样: [host, ip, network, mask, broadcast, mac, g
在 C# 中 我正在关注的一本书对设置和获取属性提出了这样的建议: double pri_test; public double Test { get { return pri_test; }
您可能熟悉 enum 位掩码方案,例如: enum Flags { FLAG1 = 0x1, FLAG2 = 0x2, FLAG3 = 0x4, FLAG4 = 0x8
在一些地方我看到了(String)value。在一些地方value.toString() 这两者有什么区别,在什么情况下我需要使用哪一个。 new Long(value) 和 (Long)value
有没有什么时候 var result = !value ? null : value[0]; 不会等同于 var result = value ? value[0] : null; 最佳答案 在此处将
我正在使用扫描仪检测设备。目前,我的条形码的值为 2345345 A1。因此,当我扫描到记事本或文本编辑器时,输出将类似于 2345345 A1,这是正确的条形码值。 问题是: 当我第一次将条形码扫描
我正在读取 C# 中的资源文件并将其转换为 JSON 字符串格式。现在我想将该 JSON 字符串的值转换为键。 例子, [ { "key": "CreateAccount", "text":
我有以下问题: 我有一个数据框,最多可能有 600 万行左右。此数据框中的一列包含某些 ID。 ID NaN NaN D1 D1 D1 NaN D1 D1 NaN NaN NaN NaN D2 NaN
import java.util.*; import java.lang.*; class Main { public static void main (String[] args) thr
我目前正在开发我的应用程序,使其设计基于 Holo 主题。在全局范围内我想做的是工作,但我对文件夹 values、values-v11 和 values-v14. 所以我知道: values 的目标是
我遇到了一个非常奇怪的问题。 我的公司为我们的各种 Assets 使用集中式用户注册网络服务。我们一般通过HttpURLConnection使用请求方法GET向Web服务发送请求,通过qs设置参数。这
查询: UPDATE nominees SET votes = ( SELECT votes FROM nominees WHERE ID =1 ) +1 错误: You can't specify
如果我运行一段代码: obj = {}; obj['number'] = 1; obj['expressionS'] = 'Sin(0.5 * c1)'; obj['c
我正在为我的应用创建一个带有 Twitter 帐户的登录页面。当我构建我的项目时会发生上述错误。 values/strings.xml @dimen/abc_text_size_medium
我在搜索引擎中使用以下 View : CREATE VIEW msr_joined_view AS SELECT table1.id AS msr_id, table1.msr_number, tab
为什么验证会返回此错误。如何解决? ul#navigation li#navigation-3 a.current Value Error : background-position Too
我有一个数据名如下 import pandas as pd d = { 'Name' : ['James', 'John', 'Peter', 'Thomas', 'Jacob', 'Andr
我是一名优秀的程序员,十分优秀!