gpt4 book ai didi

php - 如何在 PHP 中实现前向索引?

转载 作者:可可西里 更新时间:2023-10-31 22:13:04 26 4
gpt4 key购买 nike

我希望在 PHP 中实现一个简单的前向索引器。是的,我明白 PHP 并不是完成这项任务的最佳工具,但我还是想这样做。它背后的理由很简单:我想要一个,而且是在 PHP 中。

让我们做一些基本假设:

  1. 整个 Interweb 包括大约五千个 HTML 和/或纯文本文档。每个文档都驻留在特定域 (UID) 中。在我们想象的穴居人式互联网中不存在其他专有/神秘格式。

  2. 我们出色的基于 PHP 的正向索引算法的结果应该是:

    UID1 -> index.html -> helen,she,was,champion,with,freckles

    UID1 -> foo.html -> chicken,farmers,go,home,eat,sheep

    UID2 -> blah.html -> 下周,周,上,badgerwatch

    UID2 -> gah.txt -> one,one,and,one,is,not,numberwang

理想情况下,我希望看到考虑到标记化/词边界消歧/词性标记概念的解决方案,即使是在最基本的情况下。当然,我确实意识到这是一厢情愿的想法,因此将通过以下方式对任何有值(value)的解析上述虚构文档的尝试表示谦逊:

  1. 提取文档中的真实文本内容作为顺序中的单词列表他们被呈现。
  2. 一直忽略任何垃圾例如<script><html>标签来计算 UID 列表(例如,可以是域),然后是文档名称(域内的资源),最后是该文档的单词列表。我确实意识到 HTML 标签在文档中文本的语义放置方面发挥着重要作用,但在这个阶段我不关心
  3. 记住可以构建列表的解决方案阅读文档时的单词比需要的那个更酷首先阅读整个文档。

在这个阶段,我不关心存储的位置或方式。即使是一组基本的“打印”语句就足够了。

在此先感谢,希望这已经足够清楚了。

最佳答案

看看

http://simplehtmldom.sourceforge.net/

你做类似的事情

$p = new Simple_dom_parser();
$p->load("www.page.com");
$p->find("body")->plaintext;

这将为您提供所有文本。只想迭代链接

foreach ($p->find("a") as $link)
{
echo $link->innerText;
}

它非常有用和强大。检查一下。

关于php - 如何在 PHP 中实现前向索引?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/795512/

26 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com