- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我正在解析一个 XML 文件,其中一个子元素有时包含超过 4000 个字符。当它发生时,我想创建第二个元素来存储溢出字符,然后将其保存到 pandas 数据帧。构建数据框后,我将其导出到 Excel(我知道该怎么做)。
或者在解析时并且它有超过 4000 个字符,动态创建一个新的数据框列来存储数据(我认为这是更好的解决方案,因为数据导出到 Excel 进行报告)
import pandas as pd
import xml.etree.cElementTree as et
from bs4 import BeautifulSoup
def getvalueofnode(node):
if node is None:
return None
else:
soup = BeautifulSoup(node.text) # clean js keywords
text = soup.get_text()
text = text.replace("\n", " ") # remove newline
text = text.replace("\r", " ") # remove newline
text = text.replace(' +', ' ') # remove duplicate spaces
return text
parsedXML = et.parse(filename)
dfcols = ['datarec','casekey','description','narative']
df_xml = pd.DataFrame(columns=dfcols)
for node in parsedXML.getroot():
datarec = node.find('DATA_RECORD')
casekey = node.find('CASE_KEY')
description = node.find('DESCRIPTION')
narative = node.find('CASE_NARRATIVE')
df_xml = df_xml.append(pd.Series([datarec, getvalueofnode(casekey), getvalueofnode(description), getvalueofnode(narative)], index=dfcols), ignore_index=True)
我该走哪条路?
编辑------ XML 副本
<?xml version="1.0" ?>
<!DOCTYPE main [
<!ELEMENT main (DATA_RECORD*)>
<!ELEMENT DATA_RECORD (CASE_KEY,DESCRIPTION?,CASE_NARRATIVE?)+>
<!ELEMENT CASE_KEY (#PCDATA)>
<!ELEMENT DESCRIPTION (#PCDATA)>
<!ELEMENT CASE_NARRATIVE (#PCDATA)>
]>
<main>
<DATA_RECORD>
<CASE_KEY>6479351</CASE_KEY>
<DESCRIPTION>Four bill payments</DESCRIPTION>
<CASE_NARRATIVE>
Lorem ipsum dolor sit amet, consectetur adipiscing elit. Quisque accumsan congue risus, tristique imperdiet sapien consectetur nec. Donec ut urna lectus. Duis eget magna et quam aliquet porta non vitae enim. Proin diam ex, ullamcorper in lectus ac, cursus sollicitudin ipsum. Sed lorem urna, congue et condimentum in, rhoncus id nunc. Duis vel mauris pharetra, accumsan neque non, pellentesque leo. Nullam vel nibh vulputate, eleifend turpis condimentum, faucibus mi. Sed mattis dolor non libero scelerisque, in congue ligula ullamcorper. In finibus laoreet erat et venenatis. Aenean tincidunt magna a nisl euismod posuere tristique eget orci. Vestibulum ac turpis vel justo laoreet fermentum rutrum eget est. In hac habitasse platea dictumst. Aenean blandit at leo vel pharetra. Duis vel commodo orci.
Praesent tincidunt mattis suscipit. Nam aliquet purus eu nibh ultrices, ac tristique risus euismod. Sed bibendum tincidunt elit, a finibus arcu bibendum at. Praesent turpis neque, auctor at dui ut, cursus rhoncus tortor. Cras rutrum, lacus et molestie posuere, odio purus porta nisi, vel egestas nulla nibh accumsan erat. Orci varius natoque penatibus et magnis dis parturient montes, nascetur ridiculus mus. Integer imperdiet, ligula ac iaculis iaculis, augue massa dapibus neque, sit amet iaculis orci nibh quis libero. Phasellus tortor ligula, luctus non mi quis, consequat dapibus risus. Vestibulum nec finibus ex. Duis ipsum nisl, tincidunt in erat rhoncus, pulvinar consequat tortor. Curabitur faucibus interdum metus. Morbi egestas ipsum ac rutrum faucibus. Maecenas non leo sem.
In ultrices, libero ut sagittis blandit, ex dolor pretium nibh, ac bibendum ligula nunc sed quam. In ultricies, arcu aliquam porta pharetra, orci mauris imperdiet lectus, a facilisis purus purus at sem. Nullam ac feugiat nulla. Duis congue lorem sit amet tellus varius ultrices. Curabitur risus mauris, rutrum ut sodales tempor, varius eget lectus. In eget hendrerit ligula, ac mollis mi. Nulla volutpat felis ornare elit facilisis dapibus. Fusce facilisis nisi est, eget gravida lorem aliquam nec. Ut sed purus sit amet mi sodales vestibulum id sit amet purus. Ut in vestibulum purus. Donec eget enim ipsum. Mauris eget neque neque. Pellentesque feugiat faucibus felis, quis tincidunt nisl.
In viverra posuere nulla sed cursus. Praesent nec rutrum enim, et gravida lorem. Fusce gravida lorem quam. Interdum et malesuada fames ac ante ipsum primis in faucibus. Morbi at aliquam lacus. Nulla suscipit nibh eu congue finibus. Phasellus et sem non dolor tempus aliquam. Ut tincidunt elit erat, varius molestie lacus mattis feugiat. Ut lectus ex, suscipit non condimentum sit amet, condimentum vitae sem. Donec et scelerisque leo.
Suspendisse velit nisl, suscipit quis metus ac, suscipit sollicitudin libero. Nulla euismod lectus sit amet congue efficitur. Fusce a sagittis magna, ut fringilla mi. Ut suscipit lectus quis luctus euismod. Sed at dui fermentum, tincidunt risus sit amet, pretium diam. Etiam eleifend varius urna nec volutpat. Nam efficitur tellus non volutpat consequat. Mauris ut elit enim. Pellentesque sit amet tincidunt metus. Nam ornare massa quis libero fermentum sagittis. Sed facilisis turpis dolor, eget mattis lectus laoreet eu.
Aliquam egestas leo mauris, non placerat dolor euismod eu. Proin eget convallis augue. Suspendisse elit ante, ornare at augue sit amet, molestie elementum leo. Duis id leo in odio consequat auctor. Duis commodo elementum velit, porttitor blandit libero luctus commodo. Nulla in libero vel libero varius faucibus a non tellus. Pellentesque dapibus eget lectus id fringilla. Sed vitae nisi nisi. Sed ultricies orci vitae sapien ultrices, nec ornare tortor placerat. Vestibulum et ligula tristique, rhoncus dolor in, semper lorem. Integer non urna nec risus convallis pharetra. Lorem ipsum dolor sit amet, consectetur adipiscing elit. Etiam vitae ullamcorper leo. Suspendisse potenti.
Sed congue, mi rutrum placerat bibendum, erat tortor finibus lorem, eget varius velit lacus ut mauris. Nullam congue placerat mollis. Duis et fringilla nunc, id dictum enim. Morbi non gravida nisi. In nec nunc ante. In vitae odio accumsan, imperdiet lectus a, egestas sapien. In sit amet elit pharetra, scelerisque turpis a, tincidunt nisl. Curabitur tempus eu risus et vulputate. Fusce iaculis diam quis nibh viverra, pulvinar fringilla massa fermentum. Proin elementum in felis sed rutrum. Etiam eget elit vitae turpis ultrices auctor lobortis a erat. Duis fermentum tristique consectetur. Fusce quis est tincidunt, ultricies erat a, pharetra est.
Nullam ac velit et ipsum cursus sodales. Pellentesque consequat quis dui ac aliquam. Suspendisse libero turpis, porttitor quis malesuada ut, interdum ac dui. Phasellus varius suscipit tristique. Praesent vel ante vel augue pellentesque tempus. Pellentesque volutpat finibus lorem, non malesuada nisi imperdiet eget. Proin dignissim mi non lorem imperdiet, sit amet mattis neque sodales. Aliquam erat volutpat. Phasellus non nisl metus.
</CASE_NARRATIVE>
</DATA_RECORD>
<DATA_RECORD>
<CASE_KEY>6479356</CASE_KEY>
<DESCRIPTION>Financial Crime Concern</CASE_NARRATIVE>
</DATA_RECORD>
<DATA_RECORD>
<CASE_KEY>6480409</CASE_KEY>
<DESCRIPTION>Financial Crime Concern :M&S customer was cold called by someone about an investment opportunity, the caller gave customer different options and she chose 3 to invest in. She was unaware of the scam until she was contacted by the police. There is a seperate scion case re the police notification</DESCRIPTION>
<CASE_NARRATIVE><p&# Lorum Ipsum</CASE_NARRATIVE>
</DATA_RECORD>
<DATA_RECORD>
<CASE_KEY>6480519</CASE_KEY>
<DESCRIPTION>Financial Crime </DESCRIPTION>
<CASE_NARRATIVE>fraudster had set up two new payments and created </CASE_NARRATIVE>
</DATA_RECORD>
<DATA_RECORD>
<CASE_KEY>6480521</CASE_KEY>
<DESCRIPTION>Triage Europe</DESCRIPTION>
<CASE_NARRATIVE>Mr. Ockwell is a HB</CASE_NARRATIVE>
</DATA_RECORD>
</main>
最佳答案
考虑使用 lxml
来运行 XSLT 和 XPath,而不是 BeautifulSoup
:
XSLT 可以使用 substring()
转换原始 XML 以添加 OVERFLOW 元素。和 string-length()
功能。
XPath 可以解析新的、转换后的树,以便通过循环或列表/字典理解将值映射到 pandas 数据帧。
XSLT (另存为 .xslt 文件,特殊的 .xml 文件)
<xsl:stylesheet version="1.0" xmlns:xsl="http://www.w3.org/1999/XSL/Transform">
<xsl:output indent="yes" method="xml"/>
<xsl:strip-space elements="*"/>
<!-- IDENTITY TRANSFORM -->
<xsl:template match="@*|node()">
<xsl:copy>
<xsl:apply-templates select="@*|node()"/>
</xsl:copy>
</xsl:template>
<xsl:template match="DATA_RECORD">
<xsl:copy>
<xsl:apply-templates select="CASE_KEY|DESCRIPTION"/>
<CASE_NARRATIVE>
<xsl:value-of select="substring(normalize-space(CASE_NARRATIVE), 1, 4000)"/>
</CASE_NARRATIVE>
<OVERFLOW>
<xsl:value-of select="substring(normalize-space(CASE_NARRATIVE), 4001,
string-length(normalize-space(CASE_NARRATIVE)))"/>
</OVERFLOW>
</xsl:copy>
</xsl:template>
</xsl:stylesheet>
Python (包括短列表理解版本和长循环版本)
import lxml.etree as et
import pandas as pd
# LOAD XML AND XSL FILES
xml = 'Input.xml'
xsl = 'XSLT_Script.xsl'
# TRANSFORM SOURCE
transform = et.XSLT(xsl)
result = transform(xml)
# SHORT VERSION
data = [{el.tag: el.text for el in dr.xpath("*")} for dr in result.xpath("//DATA_RECORD")]
# LONG VERSION
data = []
for dr in result.xpath("//DATA_RECORD"):
inner = {}
for el in dr.xpath("*"):
inner[el.tag] = el.text
data.append(inner)
df = pd.DataFrame(data)
输出
print(df)
# CASE_KEY CASE_NARRATIVE DESCRIPTION OVERFLOW
# 0 6479351 Lorem ipsum dolor sit amet, consectetur adipis... Four bill payments s velit lacus ut mauris. Nullam congue placera...
# 1 6479356 None Financial Crime Concern None
# 2 6480409 <p Lorum Ipsum Financial Crime Concern :M&S customer was cold... None
# 3 6480519 fraudster had set up two new payments and created Financial Crime None
# 4 6480521 Mr. Ockwell is a HB Triage Europe None
关于Python、Pandas、XML - 根据长度分割 XML 元素,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/52608412/
在开发中的网页上,我在 IE 上遇到此错误 element = $(element); 此代码位于prototype.js 预期对象 如何消除此错误。 更新: 现场也使用了 jQuery。 最佳答
我有两个大小相同的嵌套数组: Array1 =[[1, 2], [], [2, 3]] Array2= [[1, 4], [8, 11], [3, 6]] 我需要将它们合并到一个数组中,如下所示: A
我有一些 jQuery 代码,当单击具有特定 ID 的项目时运行。当 ID 是 的一部分时,它就可以工作。元素,但当它位于 中时则不然元素。为什么会这样呢?我想使用 an,因为如果用户关闭了 Ja
Flex-box 规范 3声明 flex 元素不是 block 容器: A flex item establishes a new formatting context for its content
我遇到了一个意想不到的问题。 HTML JS $(function() { var $divs = $('.myDiv'); // create new div not in
我使用 Bootstrap 和 Ember.js 得到了一个无序列表。每个列表项都是一个显示新帖子的链接,每当您单击该链接时,Ember 都会添加类 active默认情况下。我正在使用 Bootstr
我正在尝试让一个函数正常工作,但运气不佳,所以我想向 Stackoverflow 智囊团提出一个新手问题! 基本上,我有一个表单,并且循环遍历所有元素以查看是否存在自定义数据属性。如果存在,则保持该元
我想映射一个可选数组,删除那些 nil 值,并使用另一个函数映射非 nil 值。 我知道我可以通过使用 compactMap 然后使用常规 map 来实现这一点,但我只想遍历数组一次。 我为此实现了一
我如何定位 li 元素,除非它们出现在 之后元素?换句话说,我想针对步骤而不是注释。 我尝试向 OL 添加一个我想从选择中排除的类,但我想出的代码不起作用。 (顺便说一句,重构 html 不是一种选
Warning 1 The element 'system.webServer' has invalid child element 'rewrite'. List of possible eleme
我正在尝试编写一个脚本,该脚本将遍历 HTML 源并创建 DOM 的 JSON 文件,然后使用 d3.js 在 TreeView 中显示该文件。我遇到的问题是不仅希望显示元素(TITLE、P、LI 等
我有以下 HTML 表单:- Option 1 Option 2
我试图在选定的 HTML 元素之后选择下一个具有类名 slider-value 的 span 元素。我尝试了多种解决方案,但没有一个有效。 我可以通过 id 选择它,但我不希望那样做使代码冗余。 $(
如果电子邮件地址无效,我想在屏幕上显示一条消息“请输入有效的电子邮件地址”。 body 元素的innerHTML 语句工作正常,但我用于p 元素的innerHTML 语句不起作用。 有一次,当我测试它
以下 jQuery 代码调用 ul 元素,查找元素内的前 三个 li 列表项,并隐藏剩余的 li 项目。然后,它附加一个 li 元素,其中显示“显示更多...”,并且在单击时显示之前隐藏的列表项。 (
我问了a question早些时候关于将编辑/删除链接与 h1 元素内联的最佳方法。我能够通过给出的答案实现这一点,但我现在有额外的要求,我需要在 h1 下方显示一个段落并编辑/删除链接。 到目前为止
我使用 MVC 4 和 knockout.js 库版本 2.1.0 显示从服务器检索到的大量文件的表中的以下摘录。 0)"> 正在正确检索数据,
我创建了一个脚本,该脚本在鼠标悬停在父容器上时激活,并且应该将其子元素移离鼠标。我目前已经让它工作了,但是代码的某些部分似乎与 REACT 代码应该是什么样子相矛盾。特别是两个部分。 我在渲染函数中使
我是 JS 新手,正在尝试理解项目 https://github.com/tastejs/todomvc 的代码 请参阅屏幕截图,我尝试对 button X 以及其父元素 div 设置断点,但在这两种
例如,假设有一个带有奇特颜色的标记: Something written here 使用 Visual Studio 2017 和 MVC 5 元素,有没有办法检查和定位当前应用了哪些样式,以及负责它
我是一名优秀的程序员,十分优秀!