- android - 多次调用 OnPrimaryClipChangedListener
- android - 无法更新 RecyclerView 中的 TextView 字段
- android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0
- android - 使用 AppCompat 时,我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色
我正在开发 XML 解析 Android 应用程序,但遇到问题。我要解析的页面有一个元素 <description>
其中有时会出现不需要的实体编码 HTML。这是结构:
<description><img src="http://images.website.it/thumbs/images/2014/12/16/asd_crop_upscale_q85.jpg" alt="Post img " style="float:left;margin-right:10px"/> Lorem ipsum...</description>
我真正想要的是Lorem ipsum...
标签 <description>
内的部分且没有编码的 HTML 。这是我的doInBackground
部分AsyncTask
@Override
protected Void doInBackground(Void... args) {
Element e = null;
XMLParser parser = new XMLParser();
String xml = parser.getXmlFromUrl(URL); // getting XML
Document doc = parser.getDomElement(xml); // getting DOM element
NodeList nl = doc.getElementsByTagName(KEY_ITEM);
// looping through all item nodes <item>
for (int i = 0; i < nl.getLength(); i++) {
// creating new HashMap
HashMap<String, String> map = new HashMap<String, String>();
e = (Element) nl.item(i);
// adding each child node to HashMap key => value
map.put(KEY_TITLE, parser.getValue(e, KEY_TITLE));
map.put(KEY_DESC, parser.getValue(e, KEY_DESC));
map.put(KEY_DATE, parser.getValue(e, KEY_DATE));
map.put(KEY_LINK, parser.getValue(e, KEY_LINK));
String descriptionElementContent = KEY_DESC;
textOnly = removeEntityEncodedHtmlTags(descriptionElementContent);
// adding HashList to ArrayList
menuItems.add(map);
}
System.out.println("prova3");
for (int c = 0; c < nl.getLength(); c++) {
e = (Element) nl.item(c);
titoli[c] = parser.getValue(e, KEY_TITLE); // name child value
descrizioni[c] = parser.getValue(e, textOnly);
date[c] = parser.getValue(e, KEY_DATE);
links[c] = parser.getValue(e, KEY_LINK);
}
return null;
}
public String removeEntityEncodedHtmlTags(String rawString) {
Matcher tagMatcher = ENTITY_ENCODED_HTML_TAG.matcher(rawString);
return tagMatcher.replaceAll("").trim();
}
@Override
protected void onPostExecute(Void s) {
adapter = new SimpleAdapter(getActivity(), menuItems, R.layout.post_list_item,
new String[]
{ KEY_TITLE,
textOnly,
KEY_DATE
}, new int[]
{
R.id.title,
R.id.description,
R.id.date
});
System.out.println("prova5");
listView.setAdapter(adapter);
pDialog.dismiss();
}
这是我第一次解析 XML,所以我不知道如何做到这一点。
这是我的XMLParser
顺便说一句:
public class XMLParser {
// constructor
public XMLParser() {
}
/**
* Getting XML from URL making HTTP request
*
* @param url string
*/
public String getXmlFromUrl(String url) {
String xml = null;
try {
// defaultHttpClient
DefaultHttpClient httpClient = new DefaultHttpClient();
HttpPost httpPost = new HttpPost(url);
HttpResponse httpResponse = httpClient.execute(httpPost);
HttpEntity httpEntity = httpResponse.getEntity();
xml = EntityUtils.toString(httpEntity);
} catch (UnsupportedEncodingException e) {
e.printStackTrace();
} catch (ClientProtocolException e) {
e.printStackTrace();
} catch (IOException e) {
e.printStackTrace();
}
// return XML
return xml;
}
/**
* Getting XML DOM element
*
* @param XML string
*/
public Document getDomElement(String xml) {
Document doc = null;
DocumentBuilderFactory dbf = DocumentBuilderFactory.newInstance();
try {
DocumentBuilder db = dbf.newDocumentBuilder();
InputSource is = new InputSource();
is.setCharacterStream(new StringReader(xml));
doc = db.parse(is);
} catch (ParserConfigurationException e) {
Log.e("Error: ", e.getMessage());
return null;
} catch (SAXException e) {
Log.e("Error: ", e.getMessage());
return null;
} catch (IOException e) {
Log.e("Error: ", e.getMessage());
return null;
}
return doc;
}
/**
* Getting node value
*
* @param elem element
*/
public final String getElementValue(Node elem) {
Node child;
if (elem != null) {
if (elem.hasChildNodes()) {
for (child = elem.getFirstChild(); child != null;
child = child.getNextSibling()) {
if (child.getNodeType() == Node.TEXT_NODE) {
return child.getNodeValue();
}
}
}
}
return "";
}
/**
* Getting node value
*
* @param Element node
* @param key string
*/
public String getValue(Element item, String str) {
NodeList n = item.getElementsByTagName(str);
return this.getElementValue(n.item(0));
}
}
我用新的 doInBackground
编辑我的任务方法。没有任何变化
最佳答案
如果您想丢弃在 description
元素中找到的所有实体编码的 HTML,则可以使用正则表达式来查找所有编码的 HTML 标记并将它们替换为空字符串,然后修剪结果字符串以删除不需要的前导和尾随空格。
您可以仅使用 String.replaceAll(String regex, String replacement)
method 来完成此操作但如果您要多次执行此操作,那么值得只创建一次 Pattern
对象,然后每次都使用它。这避免了 Java 运行时必须多次编译相同的正则表达式。
我已经测试了这段代码,它适用于您问题中的示例 XML:
private static final Pattern ENTITY_ENCODED_HTML_TAG =
Pattern.compile("<.*?>");
public static void main(String[] args) {
String descriptionElementContent =
"<img src=\"http://images.website.it/thumbs/images/2014/12/16/asd_crop_upscale_q85.jpg\" alt=\"Post img \" style=\"float:left;margin-right:10px\"/> Lorem ipsum... <br />";
String textOnly = removeEntityEncodedHtmlTags(
descriptionElementContent);
System.out.println(textOnly);
}
public static String removeEntityEncodedHtmlTags(String rawString) {
Matcher tagMatcher = ENTITY_ENCODED_HTML_TAG.matcher(rawString);
return tagMatcher.replaceAll("").trim();
}
只需将上述代码中的 main
方法替换为您自己的 description
元素循环即可。
正则表达式模式<.*?>
表示“匹配序列<
,然后匹配任何内容,直到第一次出现>
”。此模式用于实例化单个静态 Pattern
对象,该对象可用于(一遍又一遍)为传递给该方法的每个原始字符串创建一个 Matcher
对象。然后,Matcher.replaceAll
方法只是用空字符串替换(在该原始字符串中)找到的每个匹配项,以将其从结果中删除,只留下文本。
关于java - 仅从 XML 元素内的实体编码 HTML 中提取文本,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/29182800/
我对自定义 CSS 或在将图像作为 Logo 上传到页面时使用编码 block 有疑问。我正在为我的网站使用 squarespace,我需要帮助编码我的 Logo 以使其适合每个页面。一个选项是使用自
如 encoding/json 包文档中所述, Marshal traverses the value v recursively. If an encountered value implement
我必须做一些相当于Java中的iconv -f utf8 -t sjisMS $INPUT_FILE的事情。该命令在 Unix 中 我在java中没有找到任何带有sjisMS的编码。 Java中有Sh
从 PHP 5.3 迁移到 PHP 5.6 后,我遇到了编码问题。我的 MySQL 数据库是 latin1,我的 PHP 文件是 windows-1251。现在一切都显示为“ñëåäíèòå àäðå
我有一个 RScript文件(我们称之为 main.r ),它引用了另一个文件,使用以下代码: source("functions.R") 但是,当我运行 RScript 文件时,它提示以下错误:
我无法设法从 WSDL 创建 RPC/编码风格的代码 - 有谁知道哪个框架可以做到这一点? 带有 adb 和 xmlbeans 映射的 Axis2 无法正常工作(无法处理响应中的肥皂编码)直接使用 X
安装了最新版本的Node.Js()和npm包**(1.2.10)**当我运行 Express 命令来生成项目时,它向我抛出以下错误 buffer.js:240 switch (encoding &
JavaScript中有JSON编码/解码base64编码/解码函数吗? 最佳答案 是的,btoa() 和 atob() 在某些浏览器中可以工作: var enc = btoa("this is so
>>> unicode('восстановление информации', 'utf-16') Traceback (most recent call last): File "", line
我当然熟悉 java.net.URLEncoder 和 java.net.URLDecoder 类。但是,我只需要 HTML 样式的编码。 (我不想将 ' ' 替换为 '+' 等)。我不知道任何只做
有一个非常简单的 SSIS 包: OLE DB Source 通过 View 获取数据(数据库表 nvarchar 或 nchar 中的所有字符串列)。 派生列,用于格式化现有日期并将其添加到数据集(
我正在使用一个在 Node 中进行base64编码的软件,如下所示: const enc = new Buffer('test', 'base64') console.log(enc) 显示: 我正
我试图将带有日语字符的数据插入到 oracle 数据库中。事情是保存在数据库中的是一堆倒置的问号。我该如何解决这个问题 最佳答案 见 http://www.errcode.net/blogs/?p=6
当我在 java 中解压 zip 文件时,我发现文件名中出现了带有重音字符的奇怪行为。 西索: Add File user : L'equipe Technique -- Folder : spec
在网上冲浪我找到了 ExtJS 的 Ext.Gantt 插件,该扩展有一个特殊的编码。任何人都知道如何编码那样或其他复杂的形式。 Encoded Gantt Chart 最佳答案 它似乎被 Dean
我正在用C语言做一个编码任务,我进展顺利,直到读取符号并根据表格分配相应的代码的部分。我必须连接几个代码,直到它们的长度达到 32 位,为此我必须将它们写入一个文件中。这种写入文件的方法给我带来了很多
我有一个外部链接的 javascript 文件。在那个 javascript 里面,我有这个功能: function getMonthNumber(monthName){ monthName = mo
使用mechanize,我检索到一个网页的源页面,其中包含一些非ASCII字符,比如汉字。 代码如下: #using python2.6 from mechanize import Browser b
我有一个包含字母 ø 的文件。当我用这段代码 File.ReadLines(filePath) 读取它时,我得到了一个问号而不是它。 当我像这样添加编码时 File.ReadLines(filePat
如何翻译下面的字符串 H.P. Dembinski, B. K\'{e}gl, I.C. Mari\c{s}, M. Roth, D. Veberi\v{c} 进入 H. P. Dembinski,
我是一名优秀的程序员,十分优秀!