- iOS/Objective-C 元类和类别
- objective-c - -1001 错误,当 NSURLSession 通过 httpproxy 和/etc/hosts
- java - 使用网络类获取 url 地址
- ios - 推送通知中不播放声音
我想生成一个长字节数组,其中没有重复的大小为 N
的子序列。 N 很小,通常在 3 到 8 之间。
显然生成一个任意长的数组是不可行的:在大约 2^(8*N)
字节后,将有 2^(8*N)
子序列present 所以不会有任何唯一的留下来使用(因为有 2^(8*N) 个大小为 N
的唯一字节序列)。现在这是此类数组长度的上限,但不一定是下限)。我不需要可能的最长序列或类似的东西:例如,N == 4
的 1,000,000 个值可能就足够了,但至少应该可以检测到序列何时太长在某种生成策略下的唯一性。
理想情况下,生成策略很简单,就像在添加每个字节时检查每个先前的子序列一样。
我将 Java 放在具体位置,因为这是我目前正在使用它的地方,但这个概念确实适用于任何语言。
最佳答案
用户的关键观察harold in the comments , 是你可以创建一个最大序列而不用 de Bruijn sequence 重复元素N
的顺序。
这样的序列(它们不是唯一的)恰好包含所有可能的 N 元素子序列一次,因此将是一个没有 N 元素重复子序列的最大序列。
剩下的问题是,是否可以相当简单地生成此类序列的前缀,答案是肯定的。
按照本 blog post 中描述的方法进行操作可以生成所有 Lyndon Words大小为 N 或更小的数组,按字典顺序排列,并连接所有长度除以 N
的数组以创建我们想要的数组。
在 Java 中,字母表只是 256 字节的值,上述链接中的代码适用于处理固定长度的 byte[]
,如下所示:
/**
* Use an order-n de-Bruijn sequence to fill a byte array such that no n-length sub-array is repeated.
*/
public static void trucatedDeBruijnBytes(int n, byte[] arr) {
int written = generateLyndonBytes(1, 1, 256, new byte[n + 1], arr, 0);
if (written != arr.length) {
throw new RuntimeException("Can't generate a unique sequence of length " + arr.length + ", max is " + written);
}
}
private static int generateLyndonBytes(int t, int p, int k, byte[] a, byte[] output, int oidx) {
if (t == a.length) {
if((a.length-1)%p==0) {
int len = Math.min(p, output.length - oidx);
System.arraycopy(a, 1, output, oidx, len);
oidx += len;
}
} else {
a[t] = a[t-p];
assert a[t] < k;
if ((oidx = generateLyndonBytes(t+1,p, k, a, output, oidx)) == output.length) {
return oidx;
}
for(int j = (a[t-p] & 0xFF) + 1; j < k; j++) {
assert(j >= 0 && j < k);
a[t] = (byte)j;
assert a[t] < k;
if ((oidx = generateLyndonBytes(t+1,t, k, a, output, oidx)) == output.length) {
return oidx;
}
}
}
return oidx;
}
这可能可以进一步优化,但它已经相对有效:它只使用少量固定状态(byte[] a
数组,其大小为 N + 1
) 加上有限数量的递归(通常最多 N + 1
调用深度)和一些数学来“就地”生成所有值。比保留所有已见 N
序列的哈希值以执行重复数据删除的解决方案要好得多!
出于好奇,下面是 N == 2
序列的第一位:
[0, 0, 1, 0, 2, 0, 3, 0, 4, 0, 5, 0, 6, 0, 7, 0, 8, 0, 9, 0, 10, 0, 11, 0, 12, 0, 13, 0, 14, 0, ..., 125, 0, 126, 0, 127, 0, -128, 0, -127, ..., 0, -3, 0, -2, 0, -1, 1, 1, 2, 1, 3, 1, 4, 1, 5, ...]
所以 0
后跟一个简单的递增序列 0, i, 0, i + 1, ...
512 字节然后是序列 1, i , 1, i + 1, ...
等等。
关于java - 生成没有给定大小的重复子数组的长字节数组,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/47209600/
我有一个如下所示的数据框: import pandas as pd d = {'decil': ['1. decil','1. decil','2. decil','2. decil','3. dec
我有一些数据想要添加到我的应用中...大约 650 个类别(包括名称 + ID 号),每个类别平均有 85 个项目(每个都有一个名称/ID 号)。 iPhone会支持这么大的plist吗?我想首先在
我目前正在使用 Python 从头开始实现决策树算法。我在实现树的分支时遇到了麻烦。在当前的实现中,我没有使用深度参数。 发生的情况是,要么分支结束得太快(如果我使用标志来防止无限递归),要么如果
我在 Stack 上发现了这个问题 - Measuring the distance between two coordinates in PHP 这个答案在很多方面似乎对我来说都是完美的,但我遇到了
我目前正在清理一个具有 2 个索引和 2.5 亿个事件行以及大约同样多(或更多)的死行的表。我从我的客户端计算机(笔记本电脑)向我的服务器发出命令 VACCUM FULL ANALYZE。在过去的 3
这一切都有点模糊,因为该计划是相当深入的,但坚持我,因为我会尽量解释它。我编写了一个程序,它接受一个.csv文件,并将其转换为MySQL数据库的INSERT INTO语句。例如: ID Numbe
我有一个地址示例:0x003533,它是一个字符串,但要使用它,我需要它是一个 LONG,但我不知道该怎么做:有人有解决方案吗? s 字符串:“0x003533”到长 0x003533 ?? 最佳答案
请保持友善 - 这是我的第一个问题。 =P 基本上作为一个暑期项目,我一直在研究 wikipedia page 上的数据结构列表。并尝试实现它们。上学期我参加了 C++ 类(class),发现它非常有
简单的问题。想知道长 IN 子句是否是一种代码味道?我真的不知道如何证明它。除了我认为的那样,我不知道为什么它会闻起来。 select name, code, capital, pop
我正在尝试基于 C# 中的种子生成一个数字。唯一的问题是种子太大而不能成为 int32。有什么方法可以像种子一样使用 long 吗? 是的,种子必须很长。 最佳答案 这是我移植的 Java.Util.
我一直想知道这个问题有一段时间了。在 CouchDB 中,我们有一些相当的日志 ID……例如: “000ab56cb24aef9b817ac98d55695c6a” 现在,如果我们正在搜索此项目并浏览
列的虚拟列 c和一个给定的值 x等于 1如果 c==x和 0 其他。通常,通过为列创建虚拟对象 c , 一排除一个值 x选择,因为最后一个虚拟列不添加任何信息 w.r.t.已经存在的虚拟列。 这是我如
使用 tarantool,为什么我要记录这些奇怪的消息: 2016-03-24 16:19:58.987 [5803] main/493623/http/XXX.XXX.XXX.XXX:57295 t
我显然是 GitHub 的新手,想确保在开始之前我做的事情是正确的。 我想创建一个新的存储库,它使用来自 2 个现有项目的复刻/克隆。现有项目不是我的。 假设我想使用的 repo 被称为来自开发人员“
我的应用程序名称长度为 17 个字符。当安装在设备上时,它看起来像应用程序...名称。有没有办法在多行上显示应用程序名称?请帮忙。 最佳答案 不,你不能。我认为 iPad 支持 15 个字符来完整显示
我必须编写一个程序来读取文件中的所有单词,并确定每个单词使用了多少次。我的任务是使用多线程来加快运行时间,但是单线程程序的运行速度比多线程程序快。我曾尝试研究此问题的解决方案,但很多解释只会让我更加困
假设我在给定的范围内有一个位置pos,这样: 0 = newRange*newRange : "Case not supported yet"; // Never happens in my code
我试图在 Java 中将 unix 时间四舍五入到该月的第一天,但没有成功。示例: 1314057600 (Tue, 23 Aug 2011 00:00:00 GMT) 至 1312156800
我们的项目有在 CVS 中从现有分支创建新分支的历史。几年后,这导致了每次发布时更改的文件上的这种情况: 新版本:1.145.4.11.2.20.2.6.2.20.2.1.2.11.2.3.2.4.4
我有以下数据框: DAYS7 <- c('Monday','Tuesday','Wednesday','Thursday','Friday', 'Saturday', 'Sunday') DAYS
我是一名优秀的程序员,十分优秀!