- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
我的任务是读取一些文件数据,对其进行处理,然后将此数据保存到数据库中。
最近,我们开始注意到系统中出现“奇怪”的字符。看起来这是 Unicode 字符的经典案例,我们(开发人员)未能预见到,但当然应该预见到。
我们不确定处理这些数据所需的正确方法,以便最终将其正确地存入数据库。
这是高级流程:
FTP
到达在文件中。 ( xml
文件,顺便说一句。例如 hi.xml
、 foo.xml
等)Azure queue
.Sql Server
.我们无法控制输入源 - 由第三方处理。
那么 - 在 .NET 环境中,我们需要确保我们正在处理的主要信息是什么。就像..伪代码的东西..
encoding="UTF-8/16/<anything>"
在其 xml header /第 1 行中定义。NVARCHAR
(对比 VARCHAR
)我正在研究我们需要满足的要点(相对于.NET),以便我们可以读取->传递->最终从文件->队列->数据库中写入一些Unicode数据,而不会丢失或修改任何数据的这个。
旁白:如果我们收到不良数据,当然,我们无能为力。例如上游数据源在将其数据通过 FTP 发送给我们之前错误地将序列化为文件。
假设:上面的示例文件显示了一些奇怪的字符。该文件在 Visual Studio 中查看。假设这些字符是 Unicode,这就是 VS 显示它们的方式。与...这不是 Unicode,而是错误地保存了源 Unicode 的文件。
引用文献(作为我事先尝试阅读一些内容的证据):
最佳答案
解决方案是正确选择编码
。编码是二进制数据转换为字符串时使用的格式。当数据离开一个特定环境并进入下一个特定环境时,您必须特别注意。您必须确保在每次转换中都不会丢失数据(例如,如果链中存在 ASCII 格式,您将丢失一些信息)。丢失的信息无法恢复。
您必须处理以下转换,并且必须单独处理:
我假设您已经控制了转换 2. 和 3.(如果一切都是 .NET,那么这里根本没有问题)。关键问题是 1. 和 4.(但我也会处理 2.,因为你问题的第三部分提到了它)。
将 XML 读入 .NET
根据 XML 标准,XML 文件的编码可以在 XML 声明中声明,由字节顺序标记确定,也可以从外部源(例如 HTTP header )获知。在 the relevant document 的第 4.3.3 章中它说:
In the absence of information provided by an external transport protocol (e.g. HTTP or MIME), it is an error for an entity including an encoding declaration to be presented to the XML processor in an encoding other than that named in the declaration, or for an entity which begins with neither a Byte Order Mark nor an encoding declaration to use an encoding other than UTF-8.
这意味着,如果您收到的文档没有 XML 声明(标准允许)或 BOM,则必须假定它们是 UTF-8。当然,在实践中,并不总是遵循标准,因此您收到的数据格式是否正确取决于您的源与标准的严格程度(指您的第一个问题)。如果可以的话,你应该澄清这一点。根据拒绝无效数据的灵 active ,您还可以决定遵循 XML 标准(这就是标准的用途),并让源负责确保数据正确。
如果您直接使用 System.Xml
和/或 System.Xml.Linq
命名空间中的 .NET 类,尤其是直接使用 XmlReader
在二进制源上(不将其转换为字符串),会自动评估 XML 声明和 BOM,并以正确的格式读取 XML。直接从流创建 XML 读取器很简单:
Stream inputStream;
// Create a stream from your data, depending on the source (e.g. FileStream)
XmlReader reader = XmlReader.Create(inputStream);
// Use the reader
这种方式提供了完整的 unicode 支持(这应该可以回答您的第一个问题)。
将数据保存到队列
如果您对创建 JSON 的解决方案感到满意,则不应更改它。用于存储数据的编码与您使用的高级格式(纯文本、JSON、XML 等)无关。只要您使用 .NET,字符串就会以 Unicode 存储,并且您不会丢失任何数据。但是,如果您在流程链中有任何序列化/反序列化,请确保使用不涉及数据丢失的匹配编码进行序列化和反序列化(可以是 UTF-8 或 Unicode,无论您的场景中哪种更有效)。
将数据保存到数据库
根据您的源数据,您可以选择可以存储您可能遇到的任何字符的排序规则(当然您需要首先知道这一点)并使用 VARCHAR
或者您可以使用 NVARCHAR
,它将能够存储任何可能的 Unicode 文本。前者使用较少的存储空间,但如果在输入数据中发现一些意外字符,可能会导致一些数据丢失。后者可以存储任何东西,但需要双倍的空间。
关于c# - 如何在.NET 中读取包含 Unicode 的 xml 文本文件,然后将其保存到数据库中?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/46046874/
我有一个简单的 pyparsing 构造,用于提取日志消息的部分内容。看起来像这样 log_line = 时间戳 + task_info + Suppress(LineEnd()) 此结构可以很好地解
我想定义一个函数 scaryDict(),它接受一个参数(textfile)并返回 textfile 中的单词按字母顺序排列,基本上生成字典但不打印任何一个或两个字母的单词。 这是我目前所拥有的……不
我正在尝试弄清楚如何包含对外部数据文件(文本形式)的引用,我希望通过 Web Start (JNLP) 与我的应用程序一起分发该文件。筛选 JNLP 结构的文档,我发现您可以包含对 JAR、nativ
我尝试将 Java 程序从 Eclipse 导出到 .jar 文件,但遇到了问题。它运行良好,但由于某种原因它没有找到它应该从中获取数据的文本文件。如果有人能帮忙解决这个问题,我将非常感激。 最佳答案
在过去的 20 个小时里,我试图解决以下问题,所以在开始考虑跳出窗外之前我想,我最好在这里寻求帮助: I have a text file with following content: ID 1 T
今天我试图删除一个简单文本文件中的重复行,例如: input (list.txt): hello hello try output (list.txt): try 我尝试使用 Notepad++ 删除
我将一个文本文件添加到我的项目中,如下路径所示: Myproject/WebPages/stopwords.txt 图片: http://s7.postimg.org/w65vc3lx7/Untitl
所以我在我的程序上工作,现在我无法找到解决方案。我需要在 fext 文件中替换更多的符号,目前程序只将“TIT”替换为代码“*245$a”,如果我想用同样的方式替换其他字母,程序不会改变。有人知道如何
这是一个非常简单的问题,但无论我看哪里,我都会得到不同的答案(这是因为它在 c++0x 中已经改变还是将要改变?): 在 C++ 中,我如何从一个文本文件中读取两个数字并将它们输出到另一个文本文件中?
我有一个 C++ 项目应该添加 到每一行的开头和到每一行的末尾。这适用于普通英文文本,但我有一个中文文本文件,我想这样做,但它不起作用。我通常使用 .txt 文件,但为此我必须使用 .rtf 来保存中
所以我的驱动看起来像这样: #include "problem2.h" #include "problem1.h" #include "problem3.h" #include #include
我有一个包含字符串标识符的 ascii 数字文本文件(>50k 行),可以将其视为数据 vector 的集合。根据用户输入,应用程序在运行时只需要这些数据 vector 之一。 据我所知,我有 3 个
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。 要求提供代码的问题必须表现出对所解决问题的最低限度理解。包括尝试过的解决方案、为什么它们不起作用,以及预
这个问题在这里已经有了答案: 关闭 12 年前。 Possible Duplicate: Any decent text diff/merge engine for .NET ? 我有两个文本文件,
我正在尝试将对话选择器中的唤醒时间和 sleep 时间记录到这样的文本文件中,但是对方法 commitToFile2 的调用不会 append 文本文件“savedData.txt”。 我知道这段代码
我开发了一个 android webview 并尝试在单击 webview 中的链接时下载生成的数据:文本文件。 webView.setDownloadListener(new Downloa
我在一个文本文件中有 250 张图像/天 4000*3000 像素。 file '/home/user/camdata/nonseqdata.jpg' file '/home/user/camdata
我曾多次尝试将此配置文件转换为多维数组,这意味着我必须读取 config.txt 文件,然后必须将其转换为多维数组。我需要帮助或一些建议。 配置文件: id=www session.timeout=1
我正在尝试使用 sublime text 3 打开文件,我想用光标在具体行号处打开它。 我一直在查subl --help但我找不到混凝土线的选择。因此我只是使用:subl filename 有没有办法
我想在我的应用程序中快速显示一个大文本文件的内容,而不是将整个文件加载到内存中。 其他人是怎么做的? Total Commander是一个很棒的工具,它有一个很棒的内部查看器可以做到这一点。无论文件有
我是一名优秀的程序员,十分优秀!