gpt4 book ai didi

nlp - Syntaxnet 土耳其语数据集不存在的 map 文件

转载 作者:行者123 更新时间:2023-12-01 04:53:03 24 4
gpt4 key购买 nike

我是 Syntaxnet 的新手,我尝试通过 here 说明使用土耳其语的预训练模型

Point-1 : 虽然我设置了 MODEL_DIRECTORY 环境变量,但 tokenize.sh 没有找到相关路径,它给出了如下错误:

root@4562a2ee0202:/opt/tensorflow/models/syntaxnet# echo "Eray eve geldi." | syntaxnet/models/parsey_universal/tokenize.sh
F syntaxnet/term_frequency_map.cc:62] Check failed: ::tensorflow::Status::OK() == (tensorflow::Env::Default()->NewRandomAccessFile(filename, &file)) (OK vs. **Not found: label-map**)

Point-2 : 所以,我通过注释 MODEL_DIR=$1 更改了 tokenize.sh 并设置我的土耳其语模型路径如下:
PARSER_EVAL=bazel-bin/syntaxnet/parser_eval
CONTEXT=syntaxnet/models/parsey_universal/context.pbtxt
INPUT_FORMAT=stdin-untoken
MODEL_DIR=$1
MODEL_DIR=syntaxnet/models/etiya-smart-tr

Point-3 : 之后,当我按照说明运行它时,它给出如下错误:
root@4562a2ee0202:/opt/tensorflow/models/syntaxnet# echo "Eray eve geldi" | syntaxnet/models/parsey_universal/tokenize.sh
I syntaxnet/term_frequency_map.cc:101] Loaded 29 terms from syntaxnet/models/etiya-smart-tr/label-map.
I syntaxnet/embedding_feature_extractor.cc:35] Features: input.char input(-1).char input(1).char; input.digit input(-1).digit input(1).digit; input.punctuation-amount input(-1).punctuation-amount input(1).punctuation-amount
I syntaxnet/embedding_feature_extractor.cc:36] Embedding names: chars;digits;puncts
I syntaxnet/embedding_feature_extractor.cc:37] Embedding dims: 16;16;16
F syntaxnet/term_frequency_map.cc:62] Check failed: ::tensorflow::Status::OK() == (tensorflow::Env::Default()->NewRandomAccessFile(filename, &file)) (OK vs. **Not found: syntaxnet/models/etiya-smart-tr/char-map**)

我已经通过跟踪指示的链接模式下载了土耳其语包,如 download.tensorflow.org/models/parsey_universal/.zip
和我的语言映射文件列表如下:
  • -rw-r----- 1 root root 50646 Sep 22 07:24 char-ngram-map

    -rw-r----- 1 root root 329 Sep 22 07:24 label-map

    -rw-r----- 1 root root 133477 Sep 22 07:24 morph-label-set

    -rw-r----- 1 根根 5553526 Sep 22 07:24 morpher-params

    -rw-r----- 1 根根 1810 Sep 22 07:24 形态图

    -rw-r----- 1 root root 10921546 Sep 22 07:24 parser-params

    -rw-r----- 1 root root 39990 Sep 22 07:24 prefix-table

    -rw-r----- 1 根根 28958 Sep 22 07:24 后缀表

    -rw-r----- 1 根根 561 Sep 22 07:24 标签映射

    -rw-r----- 1 根根 5234212 9 月 22 日 07:24 标记参数

    -rw-r----- 1 根根 172869 Sep 22 07:24 字图

  • 问题 1:
    我知道目录中没有字符映射文件,所以我收到了上面@ Point-3 写的错误。那么,有没有人对如何进行土耳其语测试有意见,例如,对于词性,结果被共享为 %93,363 吗?

    问题 2:
    如何找到土耳其语的字符映射文件?

    问题 3:
    如果没有字符映射文件,我是否必须通过跟踪指示为 SyntaxNet's Obtain Data & Training 的步骤进行训练?

    问题 4:
    有没有办法生成word-map、char-map...等文件?是众所周知的 word2vec 方法可以用于生成能够处理 wt.map 的 map 文件吗?语法网络标记器?

    最佳答案

    试试这个 https://github.com/tensorflow/models/issues/830问题 - 它包含(此时)临时解决方案。

    关于nlp - Syntaxnet 土耳其语数据集不存在的 map 文件,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/39637442/

    24 4 0
    Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
    广告合作:1813099741@qq.com 6ren.com