Orange数据格式

数据挖掘工具Orange除了支持C4.5等格式外,还有自己的数据格式。

原生数据格式

原生的数据格式不像C4.5由多个文件组成,而是由一个单独的文件组成。该文件以.tab结尾。

其中第一行给出了数据属性的名字,类的名字 由TAB分割。

第二行给出数据的类型。连续的数据用c表示,不连续的数据用d表示。

第三行给出数据的额外信息。例如表示某列是class,或者挖掘过程中忽略某列用i表示。

下面是大名鼎鼎的尾花数据:

sepal length    sepal width    petal length    petal width    iris
c    c    c    c    d
                class
5.1    3.5    1.4    0.2    Iris-setosa
4.9    3.0    1.4    0.2    Iris-setosa
4.7    3.2    1.3    0.2    Iris-setosa
4.6    3.1    1.5    0.2    Iris-setosa
5.0    3.6    1.4    0.2    Iris-setosa
5.4    3.9    1.7    0.4    Iris-setosa
4.6    3.4    1.4    0.3    Iris-setosa
5.0    3.4    1.5    0.2    Iris-setosa
4.4    2.9    1.4    0.2    Iris-setosa
4.9    3.1    1.5    0.1    Iris-setosa
5.4    3.7    1.5    0.2    Iris-setosa
4.8    3.4    1.6    0.2    Iris-setosa
4.8    3.0    1.4    0.1    Iris-setosa
4.3    3.0    1.1    0.1    Iris-setosa
5.8    4.0    1.2    0.2    Iris-setosa
5.7    4.4    1.5    0.4    Iris-setosa
5.4    3.9    1.3    0.4    Iris-setosa
5.1    3.5    1.4    0.3    Iris-setosa
5.7    3.8    1.7    0.3    Iris-setosa

......

关于C4.5数据格式参考这里

http://www.cs.washington.edu/dm/vfml/appendixes/c45.htm


评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值