f# - 解析分层 CSV 的功能方法-6ren

f# - 解析分层 CSV 的功能方法

转载作者：行者123 更新时间：2023-12-05 00:42:10

25

4

我正在尝试创建一段代码，但无法使其正常工作。我能想到的最简单的例子是解析一些 CSV 文件。
假设我们有一个 CVS 文件，但其中的数据是以某种层次结构组织的。像这样:

Section1;
        ;Section1.1
        ;Section1.2
        ;Section1.3
Section2;
        ;Section2.1
        ;Section2.2
        ;Section2.3
        ;Section2.4

等等。

我这样做了:

let input = 
"a;
;a1
;a2
;a3
b;
;b1
;b2
;b3
;b4
;b5
c;
;c1"

let lines = input.Split('\n') 
let data = lines |> Array.map (fun l -> l.Split(';'))

let sections = 
  data 
  |> Array.mapi (fun i l -> (i, l.[0])) 
  |> Array.filter (fun (i, s) -> s <> "")

我得到了

val sections : (int * string) [] = [|(0, "a"); (4, "b"); (10, "c")|]

现在我想为每个部分创建一个行索引范围列表，如下所示:

[|(1, 3, "a"); (5, 9, "b"); (11, 11, "c")|]

第一个数字是小节范围的起始行索引，第二个 - 结束行索引。我怎么做？我正在考虑使用 fold 功能，但无法创建任何东西。

最佳答案

据我所知，没有简单的方法可以做到这一点，但这绝对是练习函数式编程技巧的好方法。如果您使用数据的一些分层表示(例如 XML 或 JSON)，情况会容易得多，因为您不必将数据结构从线性(例如列表/数组)转换为分层(在这种情况下，一个列表列表)。

无论如何，解决问题的一个好方法是意识到您需要对数据进行一些更一般的操作 - 您需要对数组的相邻元素进行分组，当您在第一个中找到具有值的行时开始一个新组柱子。

我将首先向数组添加一个行号，然后将其转换为列表(这通常在 F# 中更容易使用):

let data = lines |> Array.mapi (fun i l -> 
  i, l.Split(';')) |> List.ofSeq

现在，我们可以编写一个可重用的函数，它对列表的相邻元素进行分组，并在每次指定谓词 f 时开始一个新组。返回 true :

let adjacentGroups f list =
  // Utility function that accumulates the elements of the current 
  // group in 'current' and stores all groups in 'all'. The parameter
  // 'list' is the remainder of the list to be processed
  let rec adjacentGroupsUtil current all list =
    match list with
    // Finished processing - return all groups
    | [] -> List.rev (current::all) 
    // Start a new group, add current to the list
    | x::xs when f(x) -> 
      adjacentGroupsUtil [x] (current::all) xs
    // Add element to the current group
    | x::xs ->
      adjacentGroupsUtil (x::current) all xs

  // Call utility function, drop all empty groups and
  // reverse elements of each group (because they are
  // collected in a reversed order)
  adjacentGroupsUtil [] [] list
    |> List.filter (fun l -> l <> [])
    |> List.map List.rev

现在，实现您的特定算法相对容易。我们首先需要对元素进行分组，每次第一列有一些值时开始一个新组:

let groups = data |> adjacentGroups (fun (ln, cells) -> cells.[0] <> "")

第二步，我们需要对每个组做一些处理。我们取它的第一个元素(并选择组的标题)，然后在其余元素中找到最小和最大行号:

groups |> List.map (fun ((_, firstCols)::lines) ->
  let lineNums = lines |> List.map fst
  firstCols.[0], List.min lineNums, List.max lineNums )

请注意，lambda 函数中的模式匹配会发出警告，但我们可以放心地忽略它，因为该组将始终为非空。

摘要:这个答案表明，如果您想编写优雅的代码，您可以实现可重用的高阶函数(例如 adjacentGroups )，因为并非所有内容都在 F# 核心库中可用。如果您使用功能列表，则可以使用递归来实现它(对于数组，您将使用命令式编程，如 gradbot 的答案)。一旦您拥有一组良好的可重用功能，大多数问题都很容易:-)。

关于f# - 解析分层 CSV 的功能方法，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/2338316/

25

4

0

文章推荐： list - 对列表中的项目使用过滤器？

文章推荐：正则表达式(正则表达式)模式不包含字符串

文章推荐： mime - 响应内容类型

eclipse - 一旦在 eclipse RCP 中安装了新的插件/功能，是否有任何方法可以自动从磁盘中清除旧的插件/功能？
我正在构建一个 RCP 应用程序，其中每个季度都会更新功能/插件。因此，如果用户选择自动更新功能/插件，则会下载更新插件的新 jar，但旧插件仍在使用我不再使用的磁盘空间。我厌倦了删除包含旧 jar
extjs - 如何从外部 Controller 功能(如sencha touch中的全局功能)调用 Controller 功能
我如何从外部 Controller 功能中调用 Controller 内部的功能，例如电话间隙回调功能这是 Controller 外部定义的功能 function onDeviceReady()
dart - 检查( native )功能/类/功能(例如 MediaSource)是否可用/受支持
如果某个功能(例如 MediaSource)可用，我如何使用 Google Dart 检查。 new MediaSource() 抛出一个错误。如何以编程方式检查此类或功能是否存在？有任何想法吗？是否
azure - Orchestrator 功能 'XYZ' 失败 : The function 'XYZ' doesn't exist, 已禁用，或者不是 Orchestrator 功能
我正在尝试运行 Azure Orchestrations，突然我开始从 statusQueryGetUri 收到错误: 协调器函数“UploadDocumentOrchestrator”失败:函数“U
iphone - 在一个可执行文件中使用 iPhone OS 3.0 功能(如果可用)和 2.1 功能(如果不可用)
我见过 iPhone 上的应用程序，如果在 3.0 上运行，将使用 3.0 功能/API，例如应用内电子邮件编辑器，如果在 2.x 上运行，则不使用这些功能，并退出应用程序以启动邮件相反。这是怎么做
功能 "normalization"
这是 DB 规范化理论中的一个概念: Third normal form is violated when a non-key field is a fact about another non-ke
正确的#if 功能
如果我定义 #if SOMETHING #endif 而且我还没有在任何地方定义 SOMETHING。 #if 中的代码会编译吗？最佳答案当#if的参数表达式中使用的名称未定义为宏时(在所有其他宏
algorithm - A* 功能
我刚刚澄清了 A* 路径查找应该如何在两条路径具有相等值的 [情况] 下运行，无论是在计算期间还是在结束时，如果有两条相等的短路径。例如，我在我的起始节点，我可以扩展到两个可能的节点，但它们都具有相
Java 功能
Java有没有类似下面的东西宏一种遍历所有私有(private)字段的方法类似于 smalltalk symbols 的东西——即用于快速比较静态字符串的东西？请注意，我正在尝试为 black
c - "while()"功能？
这个程序应该将华氏度转换为摄氏度: #include int main() { float fahrenheit, celsius; int max, min, step;
LOTO示波器软件PC缓存(波形录制与回放)功能
当打开PC缓存功能后, 软件将采用先进先出的原则排队对示波器采集的每一帧数据, 进行帧缓存。当发现屏幕中有感兴趣的波形掠过时, 鼠标点击软件的(暂停)按钮, 可以选择回看某一帧的波形
r - 自定义环境中的范围(功能)
我有一个特殊的(虚拟)函数，我想在沙盒环境中使用它: disable.system.call eval(parse(text = 'model.frame("1 ~ 1")'), envir = e
ServiceStack CORS 功能
使用新的 Service 实现，我是否必须为我的所有服务提供一个 Options 方法？使用我的所有服务当前使用的旧 ServiceBase 方法，OPTIONS 返回 OK，但没有 Access-
Clojure 线程!功能
我正在阅读 Fogus 的关于 Clojure 的喜悦的书，在并行编程章节中，我看到了一个函数定义，它肯定想说明一些重要的事情，但我不知道是什么。此外，我看不到这个函数有什么用 - 当我执行时，它什么
vim - 如何限制vim的%功能？
我有大量的 C 代码，大部分代码被注释掉和/或 #if 0。当我使用 % 键匹配 if-else 的左括号和右括号时，它也匹配注释掉的代码。有没有办法或vim插件在匹配括号时不考虑注释掉或#if 0
SML map 功能
我有这个功能: map(map(fn x =>[x])) [[],[1],[2,3,4]]; 产生: val it = [[],[[1]],[[2],[3],[4]]] 我不明白这个功能是如何工作的。
Azure 功能 - 门户代码部署功能正在跳过构建
我使用 Visual Studio 代码创建了一个函数应用程序，然后发布了它。功能应用程序运行良好。我现在在功能门户中使用代码部署功能(KUDU)并跳过构建。下面是日志 9:55:46 AM
r - R如何根据现有数据创建列/功能
我有一个数据框df: userID Score Task_Alpha Task_Beta Task_Charlie Task_Delta 3108 -8.00 Easy Easy
r - 功能:将返回的数据框保存到工作区
我真的无法解决这个问题: 我有一个返回数据框的函数。但是，数据框仅打印在我的控制台中，尽管我希望将其存储在工作空间中。我怎样才能做到这一点？样本数据: n <- 32640 t <- seq(3*p
playframework - 类型安全激活器可用的命令行选项/功能
有没有办法找出所有可能的激活器命令行选项？ activator -help仅提供最低限度的可用选项/功能列表，但所有好的东西都隐藏起来，即使在 typesafe 网站在线文档中也不可用。到目前为止，

首页

博学

6Ren·AI

商城

f# - 解析分层 CSV 的功能方法