Hasil Pencarian

Ditemukan 95592 dokumen yang sesuai dengan query

Triyana Muliawati

Fuzzy c-means pada ruang eigen untuk pendeteksian topik = Fuzzy c means in eigen space for topic detection / Triyana Muliawati

"ABSTRAK

Seiring perkembangan teknologi informasi dan komunikasi, pemenuhan

kebutuhan informasi dapat diperoleh melalui media sosial, seperti Twitter.

Banyaknya pengguna internet telah memicu aliran data yang sangat besar dan

cepat, sehingga membuat analisis secara manual sulit atau bahkan tidak mungkin

dilakukan. Metode otomatis diperlukan untuk menganalisis data tersebut yang

salah satunya yaitu dengan topic detection and tracking (TDT). Suatu metode

alternatif laindari TDT untuk masalah pendeteksian topik selain latent dirichlet

allocation (LDA) adalah fuzzy clustering dengan menggunakan algoritma fuzzy Cmeans

(FCM). FCM pada pendeteksian topik dapat memenuhi asumsi bahwa

suatu dokumen pada Twitter dapat terdiri dari beberapa topik. FCM bekerja cukup

baik di dimensi data yang rendah, akan tetapi gagal dalam dimensi data yang

tinggi. Oleh karena itu, dibutuhkan suatu metode untuk mereduksi dimensi ruang

eigen yang tinggi ke dimensi yang lebih rendah. Salah satu metodenya adalah

singular value decomposition (SVD) dengan menggunakan truncated SVD. Pada

penelitian ini, dilakukan prosestruncated SVD kemudian FCM yang

dinamakanfuzzy C-means pada ruang eigen (Eigen FCM). Hasil akurasi dari

metode ini menunjukkan peningkatan lebih baik dibandingkan FCM dan LDA

pada pendeteksian topik.

ABSTRACT

As the information and communication technology developed, the fulfillment of

information can be obtained through social media, like Twitter. The enormous

number of internet users has triggeredfast and large data flow, thus making the

analysis manually is difficult, or even impossible. The automated methods for

data analysis is needed now, one of which is the topic detection and tracking

(TDT). An alternative method other than TDT fortopic detection problemother

than latent dirichlet allocation (LDA) is a fuzzy clustering algorithms using fuzzy

C-means (FCM). FCM in topic detection meet the assumption that a document on

Twitter can consists of several topics. FCM works pretty well in low-dimensional

data, but fail in high-dimensional data. Therefore, we need a method to reduce the

dimension of the high-dimensional eigenspaceinto lower dimension. One method

to do that is the singular value decomposition (SVD) using truncated SVD. This

papercarried out the truncated SVD process then FCM called fuzzy C-means on

the eigenspace (Eigen FCM). The results of the accuracy of this method shows an

increase is better than FCM and LDA on topic detection."

2016

T45625

UI - Tesis Membership Universitas Indonesia Library

Ichsani Mursidah

Analisis metode inisialisasi pada algoritma Fuzzy C-Means berbasis singular value decomposition untuk pendeteksian topik = Analysis of initialization methods on a Fuzzy C-Means algorithm based on singular value decomposition for topical detection / Ichsani Mursidah

"ABSTRAK

Pendeteksian topik adalah proses untuk menemukan topik atau pokok pembahasan utama dalam suatu kumpulan dokumen. Untuk data yang besar, pendeteksian topik dengan manual sulit atau bahkan tidak mungkin dilakukan. Sehingga, dibutuhkan metode otomatis yang dikenal dengan istilah Topic Detection and Tracking (TDT). Pada penelitian ini metode TDT yang digunakan untuk masalah pendeteksian topik adalah fuzzy C-means (FCM). FCM bekerja cukup baik pada dimensi data yang rendah, tetapi gagal pada dimensi data yang tinggi. Pada metode fuzzy c-means umumnya dilakukan inisialisasi random yang menyebabkan data konvergen ke satu pusat (centre of gravity) sehingga topik-topik yang dihasilkan antara satu dengan yang lainnya sama. Untuk mengatasi masalah tersebut dibutuhkan inisialisasi yang tidak random, yaitu dengan menggunakan inisialisasi berbasis singular value decomposition (SVD). Hasil akurasi dari metode ini menunjukkan adanya peningkatan lebih baik dibandingkan dengan metode FCM dengan inisialisasi random. Dengan nilai akurasi terbaik untuk FA Cup adalah 0,923, untuk US Elections adalah 0,661 dan untuk Super Tuesday adalah 0,727.

ABSTRACT

Topic detection is the process of finding the main topic or topic in a document. For large data, manual topic detection is difficult or even impossible. Thus, it takes an automatic method known as Topic Detection and Tracking (TDT). In this research the TDT method used for topic detection problem is fuzzy C-means (FCM). FCM works reasonably well on low data dimensions, but fails on high data dimensions. In the method of fuzzy c-means is generally done random initialization that causes data convergent to one center (center of gravity) so that the topics generated from one another are equal. To solve this problem requires non-random initialization, ie by using a singular value decomposition (SVD) based initialization. The accuracy of this method shows a better improvement compared to the FCM method with random initialization. With the best accuracy value for the FA Cup is 0.923, for US Elections is 0.661 and for Super Tuesday is 0.727."

2017

T48587

UI - Tesis Membership Universitas Indonesia Library

Yudho Prakoso

Kernelisasi metode fuzzy C-means berbasis ruang eigen untuk pendeteksian topik pada Twitter = Kernelized eigenspace based fuzzy C-means for topic detection in Twitter

"Salah satu metode otomatis untuk analisis data tekstual adalah deteksi topik. Eigenspace-based Fuzzy C-Means EFCM adalah metode berbasis soft clustering untuk pendeteksian topik. Pertama, EFCM menggunakan dekomposisi nilai tunggal terpotong untuk mengubah data tekstual dimensi tinggi menjadi data berdimensi rendah. Selanjutnya, proses pengelompokan dilakukan dalam ruang dimensi yang lebih kecil. Namun, proses transformasi itu dapat menghilangkan beberapa fitur penting dari data tekstual. Karena itu, akurasi dapat berkurang.

Dalam penelitian ini digunakan kernel trick untuk mengatasi kelemahan tersebut sehingga proses clustering dapat dilakukan dalam ruang dimensi yang lebih tinggi. Simulasi menunjukkan bahwa pendekatan ini memberikan akurasi yang lebih baik dalam menemukan topik daripada EFCM untuk masalah mendeteksi topik di Twitter.

One of automated methods for textual data analysis is topic detection. Eigenspace based fuzzy c means EFCM is a soft clustering based method for topic detection. Firstly, EFCM use truncated singular value decomposition to transform high dimensional textual data to low dimensional data. Next, the clustering process is conducted in the smaller dimensional space. However, that transformation process may eliminate some important features from the textual data. Therefore, the accuracy may be reduced.
In this study used kernel trick to overcome that weakness so that the clustering process is performed in a higher dimensional space. Simulations show that this approach gives better accuracies in term of topic recall than EFCM for the problem of sensing trending topic in Twitter."

Depok: Fakultas Matematika dan Ilmu Pengetahuan Alam Universitas Indonesia, 2018

S-Pdf

UI - Skripsi Membership Universitas Indonesia Library

Deo Lahara

Analisis kinerja inisialisasi fuzzy c-means berbasis singular value decomposition untuk masalah pendeteksian topik = Perfomance analysis of singular value decomposition based initalization method in fuzzy c-means for topic detection

"ABSTRAK

Pendeteksian topik topic detection adalah suatu proses yang digunakan untuk menganalisis kata-kata pada suatu koleksi data tekstual untuk menentukan topik-topik yang ada pada koleksi tersebut. Pendeteksian topik pada dokumen yang sangat besar sulit dilakukan secara manual sehingga dibutuhkan metode otomatis. Masalah pendeteksian topik secara otomatis dikenal dengan istilah topic detection and tracking TDT . Suatu metode alternatif TDT untuk masalah pendeteksian topik adalah fuzzy C-means FCM. Pada metode fuzzy C-means, umumnya pusat cluster ditentukan secara acak atau inisialisasi random. Namun, terkait dengan masalah dimensi yang tinggi pada inisialisasi random akan menyebabkan algoritma konvergen ke satu pusat. Sehingga, topik-topik yang dihasilkan antara satu dengan yang lainnya sama. Untuk itu, diperlukan metode untuk membuat inisialisasi yang dapat mengatasi masalah tersebut. Salah satu metode inisialisasi yang akan dikembangkan pada penelitian ini adalah metode Singular Value Decomposition SVD . Hasil simulasi menunjukan bahwa metode inisialisasi dapat mengatasi permasalahan fuzzy C-means pada data dimensi yang tinggi sehingga topik-topik yang dihasilkan tidak sama terhadap satu sama lain.

ABSTRAK

Topic detection is a process used to analyze words in a collection of textual data to determine the topics of the collection. Detecting topics on a very large document is hardly done manually so that automatic methods are needed. Automatic method to detect topics in textual documents is known as Topic Detection and Tracking TDT . An alternative method of TDT for topic detection problems is fuzzy C means FCM . In the FCM method, generally the cluster center is random initialization. However, related to the problem of high dimensional random initialization causes the algorithm to converge to one center, it means that all generated topics are similar. For that, a method is needed to create an initialization that resolves the problem. One of the initialization methods that will be developed in this research is Singular Value Decomposition SVD method. The simulation results show that the SVD initialization method can overcome the fuzzy C means problem in the high dimension data so that the resulting topics are not equal to each other. "

2017

S69378

UI - Skripsi Membership Universitas Indonesia Library

Robertus Agung Pradana

Fuzzy C-Means Clustering dengan Reduksi Dimensi Convolutional Autoencoder pada Pendeteksian Topik = Fuzzy C-Means Clustering with Convolutional Autoencoder Dimensional Reduction for Topic Detection

"Pendeteksian topik adalah suatu proses yang digunakan untuk menganalisis kata-kata pada suatu koleksi data tekstual untuk menentukan topik-topik yang ada pada koleksi tersebut, bagaimana hubungan topik-topik tersebut satu sama lainnya, dan bagaimana mereka berubah dari waktu ke waktu. Metod (FCM) merupakan metode yang sering digunakan pada masalah pendeteksian topik. FCM dapat mengelompokkan dataset ke beberapa kelompok dengan baik pada dataset dengan dimensi yang rendah, namun gagal pada dataset yang berdimensi tinggi. Untuk mengatasi permasalahan tersebut, dilakukan reduksi dimensi pada dataset sebelum dilakukan pendeteksian topik. Pada penelitian ini digunakan Convolutional Autoencoder dalam reduksi dimensi pada dataset. Oleh sebab itu, metode yang digunakan pada penelitian ini dalam pendeteksian topik adalah metode Convolutional-based Fuzzy C-Means (CFCM). Data yang digunakan dalam penelitian ini data coherence pada topik antara metode CFCM dengan satu convolutional layer (CFCM-1CL) dan metode CFCM dengan tiga convolutional layer (CFCM-3CL). Hasil penelitian ini menunjukkan bahwa nilai coherence dari metode CFCM-1CL lebih tinggi dibandingkan metode CFCM-3CL.

Topic detection is a process used to analyze words in a collection of textual data to determine the topics in the collection, how they relate to each other, and how they change from time to time. The Fuzzy C-Means (FCM) method is a clustering method that is often used in topic detection problems. Fuzzy C-Means can group dataset into multiple clusters on low-dimensional dataset, but fails on high-dimensional dataset. To overcome this problem, dimension reduction is carried out on the dataset before topic detection is carried out. In this study, Convolutional Autoencoder (CAE) is used in the reduction of dimensions in the dataset. Therefore, the method used in this research in topics detection is the Convolutional-based Fuzzy C-Means (CFCM) method. The data used in this study tweets national news account data on social media Twitter. CFCM method are divided into two stages, namely reducing the dataset dimension to a lower dimension using CAE and then clustering the dataset by using FCM to obtain topics. After the topics are obtained, an evaluation is done by calculating the value of coherence on the topics obtained. The study was conducted by comparing the coherence value on the topic between the CFCM method with one convolutional layer (CFCM-1CL) and the CFCM method with three convolutional layers (CFCM-3CL). The results of this study indicate that the coherence value of the CFCM-1CL method is higher than the CFCM-3CL method"

Depok: Fakultas Matematika dan Ilmu Pengetahuan Alam Universitas Indonesia, 2020

S-pdf

UI - Skripsi Membership Universitas Indonesia Library

Cari yang mirip

Tambahkan ke Favorit

Metadata PDF

Abstrak PDF

Abstrak

Christhoper Nugraha

Pendeteksian topik pada twitter menggunakan online eigenspace-based fuzzy c-means clustering untuk big data = Topic detection on twitter using online eigenspace-based fuzzy c-means clustering for big data / Christhoper Nugraha

"ABSTRAK
Deteksi topik adalah proses menganalisis kumpulan data tekstual untuk menentukan topik pengumpulan data tekstual. Salah satu metode pengelompokan yang dapat digunakan untuk deteksi topik adalah metode Fuzzy C-Means (FCM). Namun, penggunaan FCM sederhana untuk pendeteksian topik tentang big data kurang efektif, karena akan memakan waktu lama dan banyak memori. FCM sederhana juga memiliki masalah lain, ketika melakukan deteksi topik aktif data dimensi tinggi, FCM sederhana hanya akan menghasilkan satu topik. Dalam penelitian ini, suatu gabungan metode Single-Pass Fuzzy C-Means (SPFCM) dan Fuzzy C-Means Berbasis Eigenspace (EFCM) diusulkan, yaitu Single-Pass Eigenspace-Based Fuzzy C-Means (SPEFCM) metode untuk mengatasi masalah ini. Data yang digunakan untuk deteksi topik adalah
tweet yang berasal dari aplikasi Twitter. Lalu, keakuratan topik didapat menggunakan SPEFCM dan EFCM akan dibandingkan berdasarkan nilai koherensi. Itu hasil simulasi menunjukkan bahwa nilai koherensi topik yang diperoleh menggunakan SPEFCM adalah sebanding dengan EFCM. Ini menunjukkan bahwa SPEFCM adalah metode yang tepat untuk mendeteksi topik pada data besar, tanpa mengurangi kualitas topik yang dihasilkan.
ABSTRACT
Topic detection is the process of analyzing a textual data set to determine the topic of textual data collection. One of the grouping methods that can be used for topic detection is the Fuzzy C-Means (FCM) method. However, the use of simple FCM for the detection of topics about big data is less effective, because it will take a long time and a lot of memory. Simple FCM also has another problem, when detecting active topics of high dimensional data, simple FCM will only produce one topic. In this study, a combination of the Single-Pass Fuzzy C-Means (SPFCM) method and the Fuzzy C-Means Based on Eigenspace (EFCM) is proposed, namely the Single-Pass Eigenspace-Based Fuzzy C-Means (SPEFCM) method to overcome this problem. The data used for topic detection is
tweets that come from the Twitter application. Then, the accuracy of the topics obtained using SPEFCM and EFCM will be compared based on coherence values. The simulation results show that the topic coherence value obtained using SPEFCM is comparable to EFCM. This shows that SPEFCM is the right method for detecting topics in big data, without reducing the quality of the topics produced."

Depok: Fakultas Matematika dan Ilmu Pengetahuan Alam Universitas Indonesia, 2019

S-pdf

UI - Skripsi Membership  Universitas Indonesia Library

Cari yang mirip

Tambahkan ke Favorit

Metadata PDF

Abstrak PDF

Abstrak

Hamimah

Pemodelan topik menggunakan eigenspace-based fuzzy C-means dengan metode inisialisasi non-negative double singular value decomposition (NNDSVD) = Topic modeling using eigenspace-based fuzzy C-means with non-negative double singular value decomposition (NNDSVD) initialization method

"ABSTRAK
Pendeteksian topik adalah proses menemukan topik yang digunakan untuk menganalisis kata dalam suatu kumpulan dokumen. Pendeteksian topik secara manual pada data yang besar sangatlah sulit. Sehingga dibutuhkan metode otomatis yang dikenal dengan pemodelan topik. Salah satu metode pemodelan topik yang sering digunakan adalah metode clustering. Clustering adalah teknik pengelompokan data yang tujuannya adalah untuk mengelompokkan data tersebut sehingga anggota dari grup yang sama lebih homogen atau lebih mirip satu sama lain daripada dengan anggota kelompok yang berbeda. Metode clustering yang sering digunakan adalah Fuzzy C-Means FCM. FCM ini bekerja dengan baik pada data dengan dimensi yang rendah, namun gagal pada data dengan dimensi yang tinggi Winkler, dkk, 2011. Pada data dimensi yang tinggi, algoritma FCM konvergen ke satu pusat centre of gravity, sehingga topik-topik yang dihasilkan antara satu dengan yang lainnya sama. Salah satu pendekatan untuk mengatasi kegagalan metode FCM pada data dimensi tinggi adalah memproyeksikan data pada ruang Eigen dengan dimensi lebih rendah dan metode tersebut dikenal juga dengan Eigenspace-based Fuzzy C-Means EFCM. Pada algoritma EFCM umumnya dilakukan inisialisasi random yang menyebabkan topik yang dihasilkan tidak sama setiap kali algoritma tersebut dijalankan. Untuk mengatasi masalah tersebut dibutuhkan inisialisasi yang tidak random. Untuk itu, pada skripsi ini akan digunakan metode Nonnegative Double Singular Value Decomposition NNDSVD. Algoritma NNDSVD terdiri dari dua proses metode SVD. Hasil dari simulasi ini menunjukkan bahwa nilai akurasi dengan inisialisasi NNDSVD menunjukkan adanya peningkatan lebih baik dibandingkan dengan inisialisasi random dan NNDSVD dapat menyelesaikan masalah EFCM dengan data berdimensi tinggi.
ABSTRACT
Detection Topic is a process of finding the topics used to analyze words in a document that a collection of textual data. Detecting topic for a very large document hardly done manually. The topic detection problem is automatically known as topic modeling. One method of topic modeling that are commonly used is clustering method. Clustering is a data grouping technique which purposes is to group the data so members of each group are more homogeneous and more like each other than with different group members. This research will use fuzzy clustering method with Fuzzy C Means algorithm FCM . FCM works well on low data dimensions but it fails on high data dimensions. One approach to overcome the failure of FCM methods in high dimensional spaces is to project data on lower dimensional Eigen spaces and the method is also known as EigenSpace based FCM EFCM. In the EFCM, the algorithm did random initialization that causes the resulting topic was not same every time the algorithm runs. To solve this problem, it requires to implement non random initialization. In this study, we used the initial Nonnegative Double Singular Value Decomposition NNDSVD. The basis of the NNSVD algorithm is a two processes SVD method. This simulation results show that NNDSVD initialization method can solves the eigenspace based Fuzzy C Means problems in high dimension data and NNDSVD based initialization gives same resulted topic every executed algorithm. "

2018

S-Pdf

UI - Skripsi Membership  Universitas Indonesia Library

Cari yang mirip

Tambahkan ke Favorit

Metadata PDF

Abstrak PDF

Abstrak

Praditya Nugraha

Analisis akurasi fuzzy C-means berbasis kernel untuk pendeteksian topik pada data Twitter = Accuracy analysis kernelized fuzzy C-means for topic detection on Twitter

"Salah satu metode otomatis untuk analisis data tekstual adalah deteksi topik. Fuzzy C- Means di Ruang Eigen (EFCM) adalah metode berbasis soft clustering untuk pendetek- sian topik. Pada Algoritme EFCM adanya reduksi dimensi data awal menjadi lebih kecil. Namun, proses reduksi itu dapat menghilangkan beberapa fitur penting dari data tekstual. Sehingga, akurasi dapat berkurang. Dalam mengatasi hilangnya fitur penting digunakan bantuan Kernelisasi Fuzzy C-Means di Ruang Eigen sehingga proses clustering dapat di- lakukan dalam ruang dimensi yang lebih tinggi. Dalam penelitian ini akan dicek akurasi dari metode EFCM dan KEFCM dan perbandingannya dengan metode standar seperti Latent Dirichlet Allocation (LDA) dan Nonnegative Matrix Factorization (NMF) dalam masalah pendeteksian topik. Simulasi menunjukkan bahwa KEFCM memberikan akurasi yang lebih baik dalam menemukan topik daripada metode standar LDA dan EFCM namun tidak lebih baik dari NMF untuk masalah mendeteksi topik berita online di Twitter.
One of automated methods for textual data analysis is topic detection. Fuzzy C-Means in Eigenspace (EFCM) is a soft clustering-based method for topic detection. In, EFCM Algorithm there is a step to transform high dimensional textual data into lower dimensional data. However, that transformation process may eliminate some important features from the textual data. Therefore, the accuracy may be reduced. To overcome in losing important features Kernelized Fuzzy C-Means in Eigenspace (KEFCM) is needed, so that clustering process can be done in higher dimensional space. In this study the accuracy of EFCM and KEFCM will be evaluated and these methods will be compared by any standard method such as Latent Dirichlet Allocation (LDA) and Nonnegative Matrix Factorization (NMF) for topic detection problem. Simulations show that KEFCM gives better accuracy to find topics than LDA and EFCM method. However, these methods fail to give better results than NMF for the problem of sensing trending topic in online news in Twitter."

Depok: Fakultas Matematika dan Ilmu Pengetahuan Alam Universitas Indonesia, 2019

S-pdf

UI - Skripsi Membership  Universitas Indonesia Library

Cari yang mirip

Tambahkan ke Favorit

Metadata PDF

Abstrak PDF

Abstrak

Diyah Septi Andryani

Implementasi hybrid clustering menggunakan algoritma fuzzy c-means dan algoritma divisive untuk menganalisis kekerabatan dna human papillomavirus penyebab kanker serviks = The implementation of hybrid clustering using fuzzy c means algorithm and divisive algorithm for analysing dna human papillomavirus cause of cervical cancer

"Clustering bertujuan untuk mengklasifikasikan pola yang berbeda ke dalam kelompok yang disebut cluster. Analisis gen dengan menggunakan metode clustering dinilai lebih akurat dibandingkan analisis nukleotida menggunakan penyejajaran DNA. Hybrid clustering pada tesis ini mengkombinasikan algoritma fuzzy c-means dan algoritma divisive mampu meningkatkan keakurasian jika dibandingkan pendekatan pengelompokan partitional tradisional. Algoritma divisive akan dijalankan pada step kedua setelah hasil clustering yang diperoleh dari pengelompokan partisi fuzzy c-means.
Penentuan jumlah cluster terbaik ditentukan dari nilai Indeks Davies Bauldin yang paling minimum. Sebanyak 1252 barisan DNA HPV Human papillomavirus diperoleh dari Genbank NCBI dengan proses melakukan ekstraksi ciri DNA, selanjutnya dilakukan normalisasi. Proses ekstraksi ciri, normalisasi, dan penerapan algoritma partisi fuzzy c-means dan divisive dalam metode hybrid clustering menggunakan bantuan program open source.
Pada hasil hybrid clustering level awal diperoleh jumlah cluster optimum sebanyak 3 cluster dengan nilai Indeks Davies Bouldin paling minimum adalah 0.9715919. Pada level ke-2 clustering didapatkan cluster ke-1 terbagi atas 9 sub cluster dengan nilai IDB minimum adalah 0.8909797. Cluster ke-2 terbagi atas 2 sub cluster dengan nilai IDB minimum adalah 0.7650508. Cluster 3 terbagi atas 2 sub cluster dengan nilai IDB minimum adalah 0.9112528. Nilai IDB pada level kedua selalu lebih kecil dibanding nilai IDB pada level 1. Hal ini mengindikasikan bahwa hybrid clustering memberikan hasil yang lebih baik terhadap hasil clustering.

Clustering aims to classify the different patterns into groups called clusters. Analysis gene by using clustering method is considered more accurate than analysis of nucleotide using DNA alignment. In this thesis, hybrid clustering algorithm which combines fuzzy c means and algorithm divisive will be improve accuracy when compared to partitional clustering. Divisive algorithms will applied on second level after clustering partition using fuzzy c means.
To find the best number of clusters is determined using the minimum value of Davies Bouldin Index DBI of the cluster results. The data is 1252 sequences of HPV DNA sequences obtained from Gen Bank Database in the National Centre for Biotechnology Information NCBI at http www.ncbi.nlm.nih.gov in FASTA format. The data is converted into numerical form through feature extraction using n mers frequency.
The results on first level hybrid clustering obtained the optimum cluster divided into three clusters with the value of the minimum Davies Bouldin Index is 0.9715919. Morever, DBI values after implementing the second step of clustering are always producing smaller IDB values compare to the results of using first step clustering only. This condition indicates that the hybrid approach in this study produce better performance of the cluster results, in term its DBI values."

Depok: Fakultas Matematika dan Ilmu Pengetahuan Alam Universitas Indonesia, 2017

T47171

UI - Tesis Membership  Universitas Indonesia Library

Cari yang mirip

Tambahkan ke Favorit

Metadata PDF

Abstrak PDF

Abstrak

Muhammad Rifky Yusdiansyah

Analisis akurasi fuzzy C-means dengan reduki dimensi random projection pada pendeteksian topik = Accuracy analysis of fuzzy C-means with random projection dimensional reduction on topic detection

"Pendeteksian topik (Topic detection) adalah suatu proses yang digunakan untuk menganalisis kata-kata pada suatu koleksi data tekstual untuk menentukan topik-topik yang ada pada koleksi tersebut, bagaimana hubungan topik-topik tersebut satu sama lainnya, dan bagaimana mereka berubah dari waktu ke waktu. Metode Fuzzy C-Means (FCM) merupakan metode clustering yang sering digunakan pada masalah pendeteksian topik. Fuzzy C-Means dapat mengelompokkan dataset ke beberapa cluster dengan baik pada dataset dengan dimensi yang rendah, namun gagal pada dataset yang berdimensi tinggi. Untuk mengatasi permasalahan tersebut, dilakukan reduksi dimensi pada dataset sebelum dilakukan pendeteksian topik menggunakan metode FCM. Pada penelitian ini digunakan data tweets akun berita nasional pada sosial media Twitter yang kemudian dilakukan pen-deteksian topik menggunakan metode Random space-based Fuzzy C-Means (RFCM) dan Kernelized Random space-based Fuzzy C-Means (KRFCM). Metode pembelajaran RFCM dan KRFCM terbagi menjadi dua langkah yaitu mereduksi dimensi dataset ke dimensi yang lebih rendah dengan menggunakan random projection dan melakukan metode pem-belajaran FCM pada RFCM dan metode pembelajaran KFCM pada KRFCM. Setelah didapatkan topik-topik, kemudian dilakukan evaluasi dengan menghitung nilai coher-ence pada topik. Nilai coherence yang digunakan pada penelitian ini menggunakan sa-tuan Pointwise Mutual Information (PMI). Penelitian dilakukan dengan membandingkan nilai rata-rata PMI dari RFCM dan KRFCM dengan Eigenspace-based Fuzzy C-Means (EFCM) dan Kernelized Eigenspace-based Fuzzy C-Means (KEFCM). Hasil yang didapatkan menggunakan data tweets akun berita nasional menunjukkan bahwa metode RFCMdan KRFCM menawarkan running time untuk reduksi dimensi yang lebih cepat namun memiliki rata-rata nilai PMI yang lebih kecil dibandingkan rata-rata nilai PMI yang di-hasilkan oleh metode pembelajaran EFCM dan KEFCM.
Topic detection is a process that is used to analyze
words in a collection of textual data to determine which topics are in the collection, how the topics relate to each other, and how they change over time. Fuzzy C-Means (FCM) Method is a clustering method that is often used in topic detection problems. Fuzzy C-Means can group datasets into several clusters properly on dataset with low dimensions, but failed on the high dimension dataset. To overcome this problem, a dimension reduction is performed on the previous dataset Topic detection was performed using the FCM method. In this study used data on national news account tweets on Twitter social media which is then detected topics using the Randomspace-based Fuzzy C-Means (RFCM) method Kernelized Randomspace-based Fuzzy C-Means (KRFCM). RFCM learning methods and KRFCM is divided into two steps, namely reducing the dataset dimension to dimensions lower cost by using random projection and learning methods FCM on RFCM and KFCM learning methods on KRFCM. After obtained topics, then conducted an evaluation by calculating the value of coherence on the topic. The coherence value used in this study uses units Pointwise Mutual Information (PMI). Research carried out by comparing
the average PMI values of RFCM and KRFCM with Eigenspace-based Fuzzy C-Means (EFCM) and Kernelized Eigenspace-based Fuzzy C-Means (KEFCM). Results obtained using national news account tweets data shows that the RFCM method and KRFCM offers running time for faster dimension reduction however has an average PMI value that is smaller than the average PMI value produced by the EFCM and KEFCM learning methods."

Depok: Fakultas Matematika dan Ilmu Pengetahuan Alam Universitas Indonesia, 2019

S-pdf

UI - Skripsi Membership  Universitas Indonesia Library

Cari yang mirip

Tambahkan ke Favorit

Metadata PDF

Abstrak PDF

Abstrak

<< 1 2 3 4 5 6 7 8 9 10 >>

Hasil Pencarian :: Simpan CSV :: Kembali

Hasil Pencarian