c++ - 从包含 utf-8(HINDI) 格式文本的文件中读取并写入另一个文件-6ren

c++ - 从包含 utf-8(HINDI) 格式文本的文件中读取并写入另一个文件

转载作者：太空宇宙更新时间：2023-11-04 14:15:45

24

4

我正在尝试从文件中读取字符并删除标点符号。我想将单词存储在一个数组中，最后将它们写入另一个文件。文件的内容是:-

"यौ ता बाबू उदयभाहू उपेक्षा औंर अपमान्नकीपीड््ा ढोये जैसेतैस्ये वहबाबाके आश्रम म्पें पहैच गया । बाबा मान्नो उसी की प्रतीक्षा म्पें वैठे थे । वह ज्योही दण्डवत की मुदा म्पें हुभ्रा त्योंही बाबा का गभ्रीर स्वर उसके कानों म्पे टकराया ' आभ्रो, ञैं तुम्हारे लिए ही बैठा हूें । ' अमित न्ने मस्तक ऊैंचा उठाया औंर एकाम्र भाव न्से बाबा को देखता रहा । बाबा के पास वह अनेकों बार आ चुका था परन्तु. आज जैसी व्यथा, थकान्न औंर प्तानता इससे दूर्व नहीं थी आदमी कभ्रीकभी इतना टूट ञाता ड़ँ कि ठसे अपने अस्तिल्द के प्रति भ्री शंका होन्ने लगती न्है वह अनेक विचारों म्पें खो गया उसके नेत्र बाबा कौ देख रहे थे परन्तु उस्यका मन कहीं औंर भ्रटक रद्दा था ।"........

我尝试使用旧的 Turbo C++ 读取这些字符(印地语——utf-8)。使用简单的字符数据类型。

程序已编译但内容未正确写入文件。然后我在 visual c++ 中用相同的代码使用了相同的代码，但我得到了错误--

"Debug assertion failed ... unsigned(c+1) <=256"

接下来我尝试使用宽字符数据类型来达到这个目的。 using<wchar.h>和 <cwchar.h>头文件和数据类型 wchar_t 和其他宽字符函数，但仍然输出不正确 --"��त ྤ��௤ྤ�"

是否有任何替代方法或任何其他方法来解决此问题。

用完整的代码段回答并告诉我 wchar 的 getline 函数的替代方法是什么。这就是我尝试做的...

#include<sstream>
#include<iostream>
#include<fstream>
#include<ctype.h>
#include<string>
#include<stdio.h>
#include<conio.h>
#include <istream>
#include<vector>
#include<string>
#include<stdlib.h>
#include<iostream>
#include<fstream>
#include<ctype.h>
#include<string.h>
#include<stdio.h>
#include<conio.h>
#include<vector>
#include<wchar.h>
#include<cwchar>
#include <locale.h>
#include <cwchar>
using namespace std;
unsigned char line[1000],storech[2000],storech1[20000];
wchar_t word[50];
std::vector< wchar_t* > storewrd;

void main()
{ 
    FILE * file3 = fopen("H:\\myfile.txt" , "w");
    cout << "check" << endl;
    FILE *stream;
    stream = fopen( "H:\\ocr.txt", "r" );
    setlocale(LC_ALL,"");
    int ch;
    int  test;
    wchar_t temp1;
    wchar_t buffer[500];
    wchar_t temp[500];

    int x=0,j=0;
        do
    {
        int loop = 0;
        ch = fgetwc(stream);

        //read word 
        while( (ch != '\n') && (ch != WEOF) ) 
        {
                buffer[loop] = ch;
            loop++;


         test = fgetwc(stream);
         temp1 = (wchar_t) test;
         if(!iswpunct(test))    
         fputwc( test , file3);
             wcout << temp1 << "  ";


        }


            int t;
        if (ch!= WEOF)
        {
             for(t=0;t<loop;t++)
             {
            temp[t] = buffer[t];
             }
             temp[loop++] = '\0';

                j++;
                //cout << buffer[loop] << "  ";
        }       
    }while(ch != WEOF);

    cout << "check";


    _getch();

}

最佳答案

我不太清楚你想做什么:发生断言失败？您如何尝试确定字符是标点符号还是不是？

UTF-8是多字节编码，也就是说单字节ispunct 之类的函数对它不起作用。它是一个可变长度然而，编码以及原始 ASCII 代码中的所有字符set 具有单字节编码。如果你是唯一的标点符号关心的是原始 ASCII 中的字符，你可以“作弊”一点，然后使用类似的东西:

if ( (ch & 0x80) == 0 && ispunct( ch ) ) {
    //  is ASCII punctuation
} else {
    //  is something else
}

我把“作弊”放在引号中，因为 Unicode 的目标之一UTF-8 是查找 ASCII 标点符号之类的代码应该可以正常工作。

如果您需要识别的不仅仅是 ASCII 标点符号(例如事物例如 «、¿ 或 —)，并且您想使用 wchar_t(通常，但不总是 UTF-16 或 UTF-32)，文件是UTF-8，您需要使用适当的语言环境来执行代码翻译。在这种情况下，您应该绝对使用 iostream，并且不是 C 风格的 IO； iostream 将允许您将流与适当的语言环境，而 C++ 语言环境将允许您在苍蝇，通过改变一个方面(codecvt，在这种情况下)从另一个语言环境(可能是全局语言环境)。 (在 Linux 下，全局语言环境，特别是在非英语地区，通常是 UTF-8locale，可以直接使用。在 Windows 下，我希望它能是 UTF-16 语言环境，它不会正确翻译 UTF-8。)如果你不想涉及语言环境，直接将你的 UTF-8 读入char 缓冲区，并使用 iconv 库或类似的东西在你的程序中翻译它。但是请注意，可能有是基本平面之外的一些罕见标点符号，这将是使用 UTF-16 中的两个代理字符编码； iswpunct 不会如果您的 wchar_t 使用 UTF-16(Windows 和 AIX)，请为这些工作。 (最多基本平面外的字符是 CJK 或来自历史今天不使用的脚本，所以这对你来说可能不是问题。)

关于c++ - 从包含 utf-8(HINDI) 格式文本的文件中读取并写入另一个文件，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/11427103/

24

4

0

文章推荐： php - 从我的数据库中获取指定信息

文章推荐： python - 在 Django 1.7 中使用 html 发送电子邮件

文章推荐： java - Scala 可迭代和 Java 可迭代

文章推荐： html - Bootstrap 一行中的多个文本框

java - 以 Clojure 格式(java.util.Formatter)、cl 格式(Common Lisp 格式)以编程方式控制填充？
有没有办法使用 Clojure format(基于 java.util.Formatter)或 cl-format(基于 Common Lisp 的format) 以编程方式设置空格填充？如果您事先知
java - 在数据库和 postman 上无法看到实际上传的文件(.pdf 格式)格式？
我正在尝试创建一个用户实体以及数据/文件(pdf格式)。上传并保存到数据库很好，但是当我让用户进入 postman 时尝试发送获取请求方法，然后在数据字段中显示一些糟糕的数据，而且我无法在数据库中看到
java - 将字符串转换为 ASCII 格式，然后再转换为 HEX 格式
我必须将值为 {"STX","ETX"} 的普通字符串数组转换为十六进制值，并且我应该根据 http://www.asciitable.com/ 得到 {2,3} . 最佳答案听起来你想要一个 Ma
flutter - dartfmt vs dart 格式 vs flutter 格式
我想格式化我的代码，但不确定哪种格式类型最适合我的项目需要。我发现仅对于 dart 和 flutter 项目(我都有)，有不止一个选项可用于格式化编程语言/框架中预先构建的代码。 Dart : da
excel - 我的 excel 文件是德国(德语)格式，想更改为英语(英国)格式
我已经尝试了多个代码，例如这样 Sub DateFixer() Application.ScreenUpdating = False Application.Calculation =
java - 当我查询 SOLR 时，我希望输出为 csv 格式，但输出仍然为 javabin 格式
SolrQuery query = new SolrQuery(); query.setQuery("*:*"); query.add("wt","csv"); server.query(query)
c++ - 将 QString 日期(RFC 822 格式)转换为另一种基于文化的 QString 格式
我有一个包含多个字符串的数据库，我从查询中获取了这些记录，并且我在 QString 中收到了这种格式的数据: "Mon, 13 Nov 2017 09:48:45 +0000" 所以，我需要根据文化来
xml - 如何在未安装 Excel 的情况下将 DBGrid 导出为 OOXML 格式(Excel 2007/2010 格式)？
我有一个 Delphi 2007 DBGrid，我想让用户以更新的 Excel 格式 (OOXML) 保存它，但我的标准是用户不需要安装 Excel。有没有人知道任何已经这样做的组件？是的，我已经搜索
ruby-on-rails - 在 rails 3.1 中更改 View 格式(提供移动 html 格式，回退到普通 html)
我正在我们的普通 html 站点旁边创建一个移动站点。使用 rails 3.1。移动站点在子域 m.site.com 中访问。我已经定义了移动格式(Mime::Type.register_alias
xmlstarlet 格式
我正在尝试使用 xmlstarlet 格式化 xml 文件，但我不想创建新的 xml 文件。我试过了 xmlstarlet fo --inplace --indent-tab --omit-decl
Excel 格式
我在 A 列中有一个带有文本的电子表格。例如 A1=MY TEXT1 A2=MY TEXT2 A3=MY TEXT3 A4=MY TEXT4 A5=MY TEXT5 我想在文本的前后添加撇号结果是
解析haskell保留注释/格式
我想做一些源代码转换(自动导入列表清理)，我想保留注释和格式。我听说过一些关于解析器这样做的事情，我认为是 ghc 解析器。看起来我可以通过从文件中提取内容来使用 hs-src-exts Langu
用于使值相等的 Excel 格式
我在 Excel 中工作，我想根据另一张表中的列表找出一张表中是否有匹配项。我已将值粘贴到列表中，并希望从另一张表中返回它们的相应值。包含字母和数字的单元格可以正常工作(例如:D5765000)，但
django - DurationField 格式
我有一个 DurationField在我的模型中定义为 day0 = models.DurationField('Duration for Monday', default=datetime.time
wmi - PNPDeviceID 格式
我正在为我的应用程序开发 WMI 查询。它需要为给定的 VID/PID 找到分配的虚拟 COM 端口。使用 WMI Code Creator 我发现...... 命名空间:root\CIMV2 类:W
swift - NSTextList 格式
我试图弄清楚如何使用 NSTextList，但除了 this SO question 之外，在网上几乎没有找到有用的信息。和 the comment in this blog . 使用这个我已经能够创
Oracle last_ddl_time 格式
我要查询all_objects表在哪里last_ddl_time='01 jan 2010'但它拒绝日期格式... 任何机构给我查询的确切格式？最佳答案正如 AKF 所说，您应该使用 Trunc除
Java JEditorPane 格式
我试图在我的应用程序中实现聊天功能。我使用了 2 个 JEditorPane。一个用于保存聊天记录，另一个用于将聊天发送到前一个 JEditorPane。 JEditorPane 是 text/h
assembly - 玩具编译器的输出语言/格式
我在大学里修了一个编译器类(class)，内容非常丰富，很有趣，尽管也很多工作。既然给了我们要实现的语言规范，所以我学不到的一件事就是语言设计。我现在正在考虑创建一种有趣的简单玩具语言，以便我可以玩耍
gradle - Gradle异常的结构/格式
Closed. This question does not meet Stack Overflow guidelines。它当前不接受答案。想改善这个问题吗？更新问题，以便将其作为on-topic

首页

博学

6Ren·AI

商城

c++ - 从包含 utf-8(HINDI) 格式文本的文件中读取并写入另一个文件