Thesis Title Ideation — July 8, 2026
Generated from 1,000 real arXiv papers (20 Tirana-aligned queries × 50 results). Queries are tailored to Tirana Noor Fatyanosa, S.Kom., M.Kom., Ph.D.’s research areas: RoBERTa/IndoBERT emotion, BERT text classification, BERT2BERT dialogue, HDBSCAN clustering, cyber log analysis, low-resource Indonesian NLP. UB Informatics thesis topics at repository.ub.ac.id guided query selection.
🧠 RoBERTa, Emotion Detection & Sentiment Analysis
- RoBERTa-MultiEmo: A Hierarchical Multi-Class Emotion Detection Framework for English Social Media Text — Gap: Tirana’s UB thesis (Farid Muzaki, 2026) applies RoBERTa for English emotion; no comprehensive multi-dataset benchmark with class imbalance handling.
- IndoBERT-Sentiment-Attention: Visualizing Attention Mechanisms for Explainable Indonesian Sentiment Analysis — Gap: Tirana UB thesis (Brigitta Nilapaksi, 2026) uses IndoBERT for Twitter sentiment; explainability via attention visualization is absent.
- Cross-Lingual Emotion Transfer: Fine-Tuning RoBERTa for Indonesian Social Media Emotion Detection — Gap: RoBERTa for English emotion is well-studied; cross-lingual zero-shot to Indonesian is unexplored.
- Emotion-Cause Pair Extraction in Code-Mixed Indonesian-English Text Using Fine-Tuned BERT — Gap: Emotion analysis UB theses (2024-2026) don’t explore emotion-cause pairs or code-mixed data.
- IndoMultiEmo: A Multi-Label Emotion Dataset for Indonesian Using Distant Supervision from Emojis — Gap: No large-scale Indonesian multi-label emotion dataset exists; current UB theses use limited labeled data.
- Comparative Study of RoBERTa, IndoBERT, and mBERT for Emotion Detection in Indonesian Short Texts — Gap: Tirana’s UB thesis uses RoBERTa for English; systematic comparison for Indonesian is missing.
- Few-Shot Emotion Recognition in Indonesian Using Prompt-Based Learning with Pretrained Language Models — Gap: Low-resource emotion recognition (UB Tirana 2026 focus on limited data) with prompt tuning is novel.
- Aspect-Based Sentiment Analysis for Indonesian Product Reviews Using IndoBERT Augmented with Syntax Trees — Gap: IndoBERT sentiment (Tirana 2026) is sentence-level; aspect-based analysis with syntax augmentation is a gap.
- Temporal Sentiment Analysis of Indonesian Twitter Data Using Incrementally Fine-Tuned IndoBERT — Gap: Tirana’s sentiment thesis is static; temporal/dynamic sentiment tracking via incremental learning is unexplored.
- Multi-Task Emotion and Sentiment Joint Learning for Indonesian Using Shared BERT Encoders — Gap: Emotion and sentiment are treated separately in UB theses; joint multi-task learning is a methodological gap.
- Sarcasm-Aware Sentiment Detection in Indonesian Social Media Using RoBERTa with Contrastive Learning — Gap: Sarcasm detection is absent from Indonesian emotion/sentiment literature found in UB repository.
- Domain-Adaptive Pretraining of IndoBERT for Financial Sentiment Analysis in Indonesian — Gap: IndoBERT fine-tuning (Tirana 2026) focuses on general Twitter; domain-specific (finance) adaptation is a gap.
- Lightweight Distilled RoBERTa for Real-Time Indonesian Emotion Detection on Edge Devices — Gap: RoBERTa emotion model (Tirana 2026) is resource-heavy; edge deployment via distillation is unexplored.
- Ensemble of Multilingual BERT Variants for Robust Emotion Detection Across Indonesian Regional Languages — Gap: Indonesian emotion detection (UB theses) covers Bahasa only; Javanese/Sundanese emotion is open.
- Active Learning for Efficient Annotation of Indonesian Emotion Datasets Using Uncertainty Sampling — Gap: UB Tirana thesis (Rizky Dwi Purnomo, 2024) compares preprocessing/fine-tuning but not active learning for annotation efficiency.
📊 BERT Fine-Tuning & Text Classification
- Beyond Token-Level: Investigating the Effect of Preprocessing Strategies on BERT Fine-Tuning for Indonesian Text Classification — Gap: Rizky Dwi Purnomo’s UB thesis (2024) compares preprocessing methods; no systematic study on preprocessing effects across multiple BERT variants.
- Parameter-Efficient Fine-Tuning for Indonesian BERT: LoRA, Adapters, and Prefix Tuning Compared — Gap: Tirana UB thesis (2024) uses full fine-tuning; PEFT methods like LoRA are untested for Indonesian BERT classification.
- Data Augmentation Strategies for Limited-Dataset BERT Fine-Tuning in Indonesian NLP — Gap: Tirana’s UB thesis on limited data NLP (2026) suggests data scarcity; augmentation strategies for Indonesian are unstudied.
- Robustness Evaluation of Fine-Tuned BERT Models Under Adversarial Input Perturbations in Indonesian — Gap: BERT text classification (UB theses) doesn’t evaluate adversarial robustness for Indonesian language inputs.
- Semi-Supervised BERT Fine-Tuning with Self-Training for Indonesian Text Classification with Limited Labels — Gap: Limited data is a recurring theme in Tirana’s supervision; semi-supervised BFT for Indonesian is absent.
- Cross-Domain Transfer Learning for BERT Text Classification: From Indonesian News to Legal Documents — Gap: UB Tirana BERT classification thesis covers general text; cross-domain transfer for specific domains is a gap.
- Multi-Task Text Classification for Indonesian Using Shared BERT Layers with Task-Specific Heads — Gap: All UB BERT theses are single-task; multi-task classification with shared encoder is underexplored.
- Calibrating Fine-Tuned BERT Confidence Scores for Indonesian High-Stakes Classification Tasks — Gap: Model calibration (confidence scoring) is not addressed in UB text classification theses.
- Continual Fine-Tuning of Indonesian BERT: Avoiding Catastrophic Forgetting Across Sequential Tasks — Gap: UB Tirana theses do one-shot fine-tuning; continual learning for BERT in Indonesian is novel.
- IndoBERT vs. XLM-R vs. mBERT: A Fair Benchmark for Indonesian Text Classification Under Controlled Preprocessing — Gap: Tirana’s 2024 thesis compares preprocessing but not comprehensively across model architectures.
- Uncertainty-Aware Fine-Tuning of BERT for Indonesian Text Classification with Rejection Option — Gap: No Indonesian BERT classification study incorporates prediction uncertainty or rejection of low-confidence samples.
- Federated BERT Fine-Tuning for Privacy-Preserving Indonesian Text Classification — Gap: Federated BFT (arXiv papers) exists for English; no study applies federated fine-tuning to Indonesian data.
- Class-Imbalanced BERT Fine-Tuning for Indonesian Text: A Comparative Study of Cost-Sensitive and Resampling Methods — Gap: UB Rizky Dwi Purnomo’s thesis (2024) doesn’t address class imbalance, a practical issue in real Indonesian datasets.
- Curriculum Learning for Progressive BERT Fine-Tuning on Indonesian Text Classification — Gap: Curriculum learning ordering of training data for BFT is unexplored for Indonesian.
- Green AI for Indonesian BERT Fine-Tuning: Energy-Efficient Training with Early Stopping and Pruning — Gap: Computational cost of BFT (Tirana 2024) is not analyzed; energy-efficient fine-tuning is an underexplored direction.
💬 Dialogue Generation & BERT2BERT
- BERT2BERT-Indo: Enhancing Encoder-Decoder Pretraining for Indonesian Chatbot Response Generation — Gap: Femi Novia Lina’s UB thesis (2024) applies BERT2BERT for Indonesian dialogue; limited dataset size is the key challenge.
- Data-Efficient BERT2BERT Fine-Tuning for Indonesian Task-Oriented Dialogue with Prompt-Based Initialization — Gap: UB BERT2BERT thesis uses limited data (2024); prompt-based few-shot dialogue is a gap.
- Evaluating BERT2BERT, T5, and GPT-2 for Indonesian Open-Domain Dialogue Generation — Gap: BERT2BERT for Indonesian (UB 2024) hasn’t been compared against T5 or GPT-2 variants.
- Hybrid Retrieval-Augmented BERT2BERT for Indonesian Knowledge-Grounded Dialogue — Gap: Tirana UB BERT2BERT thesis is purely generative; RAG-enhanced dialogue with retrieval is unexplored.
- Multitask BERT2BERT for Joint Intent Classification and Response Generation in Indonesian — Gap: UB dialogue thesis (2024) does single-task generation; joint intent+response multitask is a gap.
- Controllable Indonesian Dialogue Generation with BERT2BERT Using Attribute-Conditioned Decoding — Gap: BERT2BERT response generation (UB 2024) doesn’t support controllable attributes like tone or formality.
- Low-Resource Indonesian Chatbot Training Using Back-Translation and Self-Training with BERT2BERT — Gap: Data scarcity is the core limitation of UB BERT2BERT thesis (2024); data augmentation via back-translation is unexplored.
- Dialogue State Tracking for Indonesian Task-Oriented Chatbots Using Fine-Tuned BERT — Gap: UB BERT2BERT thesis covers response generation but not dialogue state tracking for task completion.
- IndoPersonaChat: A Persona-Consistent Dialogue Dataset for Indonesian Using BERT2BERT — Gap: No persona-based Indonesian dialogue dataset exists; BERT2BERT fine-tuning with persona context is novel.
- Evaluation Metrics for Indonesian Open-Domain Dialogue: Human Judgement vs. Automated Metrics — Gap: UB Tirana thesis (2024) uses automated metrics; human evaluation framework for Indonesian dialogue is missing.
🔒 Clustering, HDBSCAN & Cybersecurity
- HDBSCAN vs. DBSCAN for Web Server Log Anomaly Detection: A Comparative Study — Gap: Naufal Akmal’s UB thesis (2026) uses HDBSCAN for cyber log investigation; no systematic comparison against DBSCAN variants exists.
- Deep Embedding + HDBSCAN: A Hybrid Approach for Unsupervised Cyber Threat Clustering — Gap: Tirana’s UB cyber thesis (2026) uses raw HDBSCAN; deep embedding pre-clustering is an underexplored enhancement.
- Transformer-Based Log Embeddings for HDBSCAN Clustering of Web Server Attacks — Gap: UB cyber investigation thesis uses log features directly; transformer (BERT) log embeddings for HDBSCAN are novel.
- Temporal HDBSCAN: Time-Aware Clustering of Sequential Cyber Attack Patterns — Gap: HDBSCAN is static; time-aware clustering of attack sequences is a methodological gap.
- Visual Analytics Dashboard for HDBSCAN Clustering of Cyber Security Logs — Gap: UB cyber thesis (2026) produces cluster output; interactive visualization for security analysts is absent.
- Incremental HDBSCAN for Real-Time Web Server Log Anomaly Detection — Gap: HDBSCAN (UB 2026) is batch; incremental/online version for real-time detection is a gap.
- Parameter-Free HDBSCAN: Automatic MinPts Selection for Cyber Log Clustering — Gap: HDBSCAN requires parameter tuning (min cluster size); automated selection for cyber logs is unexplored.
- Explainable Log Anomaly Detection: Interpreting HDBSCAN Clusters with SHAP Values — Gap: UB cyber thesis (2026) detects but doesn’t explain clusters; XAI for clustering is a gap.
- Multi-Source Log Fusion for Clustering: Combining Web Server, Database, and Firewall Logs — Gap: UB thesis (2026) focuses on web server logs; multi-source log clustering is an extension gap.
- Benchmarking Clustering Algorithms for Indonesian University Cyber Attack Logs — Gap: UB repository shows cyber investigation (2026) on general logs; no benchmark exists for Indonesian academic network data.
- Graph-Based Clustering of Network Attack Patterns Using HDBSCAN on Flow Data — Gap: Tirana UB thesis (2026) clusters log text; graph-structured attack patterns with HDBSCAN are a gap.
- Semi-Supervised HDBSCAN with Constrained Clustering for Labeled Cyber Threat Intelligence — Gap: UB thesis uses unsupervised HDBSCAN; semi-supervised constraints from known attack signatures are underexplored.
- HDBSCAN-Based Feature Selection for High-Dimensional Cyber Log Data — Gap: Dimensionality reduction before HDBSCAN clustering is not addressed in UB cyber thesis (2026).
- Adaptive Thresholding for HDBSCAN in Non-Stationary Web Server Log Environments — Gap: HDBSCAN assumes stable density; adaptive thresholds for concept drift in logs is a gap.
- Ensemble Clustering for Cyber Attack Detection: Combining HDBSCAN with K-Means and Spectral Clustering — Gap: UB thesis (2026) uses single algorithm; ensemble clustering for robustness is unexplored.
🌏 Low-Resource Indonesian NLP
- IndoLimited: A Benchmark for Low-Resource Indonesian NLP with Controlled Dataset Sizes — Gap: Tirana UB thesis on limited data NLP (2026) lacks a standardized low-resource benchmark.
- Cross-Lingual Transfer from English to Indonesian for NER: When Does It Work Best? — Gap: Multilingual BERT fine-tuning (UB Tirana area) for cross-lingual NER transfer is unstudied.
- Adapter-Based Multilingual BERT for Indonesian Regional Languages: Parameter-Efficient Cross-Lingual Transfer — Gap: Parameter-efficient fine-tuning for Indonesian NLP (Tirana 2026 focus) not tested for regional languages.
- IndoFewShot: A Few-Shot Learning Benchmark for Indonesian Text Classification — Gap: Limited data (UB Tirana 2026) motivates few-shot learning; no few-shot benchmark exists for Indonesian.
- Self-Training with Noise for Low-Resource Indonesian NER Using IndoBERT — Gap: Tirana’s limited data NLP thesis (2026) can be extended with self-training approaches.
- Generative Data Augmentation Using LLMs for Indonesian Text Classification with Limited Training Data — Gap: UB limited data thesis doesn’t use LLM-based augmentation; synthetic data generation is a gap.
- IndoZeroShot: Zero-Shot Cross-Lingual Transfer for Indonesian NLU Using Multilingual Encoders — Gap: Cross-lingual NLU evaluation (Tirana 2026) can be extended to zero-shot transfer scenarios.
- Ensemble of Weakly Supervised Models for Indonesian Text Classification with Minimal Annotations — Gap: Limited data context (UB Tirana 2026) benefits from weak supervision; not yet explored.
- Label-Efficient Indonesian Sentiment Analysis Using Contrastive Pretraining on Unlabeled Data — Gap: Contrastive learning for label efficiency in Indonesian NLP is absent from literature.
- In-Context Learning vs. Fine-Tuning for Few-Shot Indonesian Text Classification with LLMs — Gap: Limited data (UB 2026) comparison between ICL and fine-tuning for Indonesian is a gap.
- Domain-Specific Indonesian BERT Pretraining with Limited Compute Using Curriculum Masking — Gap: Pretraining IndoBERT (rather than fine-tuning) on limited compute is novel for Indonesian NLP.
- IndoDataFree: Zero-Resource Indonesian Text Classification Using Cross-Lingual Embedding Alignment — Gap: No Indonesian-labeled data scenarios are unexplored; CL alignment for zero-resource classification is a gap.
- Meta-Learning for Rapid Adaptation of Indonesian NLP Models to New Domains — Gap: Meta-learning for low-resource Indonesian NLP adaptation (MAML, Reptile) is untested.
- Privacy-Preserving Indonesian NLP: On-Device Fine-Tuning with Federated Learning for Limited Data — Gap: Limited data + privacy (UB Tirana areas) combine for on-device federated learning in Indonesian.
- IndoAugment: A Comprehensive Data Augmentation Toolkit for Indonesian NLP — Gap: No toolkit exists for Indonesian-specific data augmentation (unlike NL-Augmenter for English).
⚙️ Cross-Domain & Applied (Aligned to Tirana’s Supervision)
- IndoBERT-Clinical: Fine-Tuning BERT for Indonesian Clinical Text Classification — Gap: BERT clinical text survey (Tirana 2026) covers general clinical; no Indonesian clinical BERT exists.
- RoBERTa for Indonesian Fake News Detection: A Multi-Aspect Attention Approach — Gap: RoBERTa emotion (Tirana UB 2026) can extend to fake news detection; no Indonesian benchmark exists.
- BERT2BERT with External Knowledge for Indonesian Customer Service Chatbot — Gap: BERT2BERT dialogue (UB 2024) without knowledge grounding; KIBERT extension is a gap.
- HDBSCAN Clustering of Indonesian Social Media Bots Based on Behavioral Patterns — Gap: HDBSCAN for cyber (UB 2026) on server logs; applying to social media bot detection in Indonesian is novel.
- IndoBERT for Indonesian Legal Document Classification: A Comparative Study of Fine-Tuning Strategies — Gap: BERT classification (Tirana 2024) on general data; legal domain adaptation is unexplored.
- Emotion-Aware Indonesian Chatbot Using Fine-Tuned IndoBERT with Emotion Embeddings — Gap: Combines Tirana’s two tracks: BERT2BERT dialogue (2024) + emotion detection (2026).
- Lightweight Indonesian BERT for Mobile Deployments: Knowledge Distillation with Limited Teacher Data — Gap: Limited data (Tirana 2026) + model compression; knowledge distillation for Indonesian BERT is a gap.
- Indonesian Cyber Threat Intelligence Classification Using Fine-Tuned xlm-RoBERTa — Gap: Cyber log clustering (UB 2026) + cross-lingual models; CTI classification in Indonesian is a gap.
- Active Learning for Indonesian NER in Biomedical Texts with Limited Annotations — Gap: Limited data NLP (Tirana 2026) + active learning; biomedical NER for Indonesian is absent.
- IndoCOVID-Tweet: Fine-Grained Sentiment Analysis of Indonesian COVID-19 Tweets Using IndoBERT — Gap: IndoBERT sentiment (UB 2026) applied to health crisis tweets; domain-specific fine-tuning for pandemics is a gap.
- Multilingual BERT for Indonesian Offensive Language Detection in Code-Mixed Social Media — Gap: Emotion classification (UB 2026) can extend to offensive language; code-mixed detection is a gap.
- Parameter-Efficient Fine-Tuning of Indonesian BERT for Multi-Domain Text Classification with Adapters — Gap: Parameter-efficient tuning (Tirana aligned) for multi-domain classification with domain-specific adapters.
- Semi-Supervised Clustering for Indonesian News Topic Discovery Using Sentence-BERT + HDBSCAN — Gap: HDBSCAN (UB 2026) + SBERT embeddings for Indonesian news topic clustering is a gap.
- Fine-Grained Emotion Trajectory Prediction in Indonesian Narrative Text Using RoBERTa — Gap: RoBERTa emotion (2026) as static; emotion trajectory over narrative progression is novel.
- Indonesian Hate Speech Detection Using IndoBERT with Graph Neural Network for Social Network Context — Gap: IndoBERT sentiment (UB 2026) doesn’t incorporate social graph context; GNN+IndoBERT is a gap.
- Low-Resource Indonesian Summarization Using BART with Limited Parallel Data — Gap: Limited data NLP (Tirana 2026) for summarization; BART fine-tuning for Indonesian with little data.
- Explainable Indonesian Sentiment Analysis Using Attention Rollout and LIME with IndoBERT — Gap: Explainable BERT (Tirana 2026 aligned) applied to Indonesian sentiment; no existing XAI benchmark.
- Cross-Lingual Emotion Transfer from English RoBERTa to Indonesian Using Adapter Layers — Gap: RoBERTa emotion (2026) for English; cross-lingual transfer to Indonesian using adapters is a gap.
- IndoBERT for Student Feedback Sentiment Analysis in Indonesian Higher Education — Gap: Applied sentiment analysis (UB context) for Indonesian education feedback; nearest to Tirana’s UB environment.
- Federated HDBSCAN for Privacy-Preserving Cross-Organization Cyber Log Clustering — Gap: HDBSCAN (UB 2026) + federated learning; privacy-preserving clustering across universities is a gap.
- Continual Few-Shot Learning for Indonesian Text Classification: Adapting to New Topics Without Forgetting — Gap: Limited data (Tirana 2026) + continual learning; few-shot incremental learning for Indonesian is a gap.
- IndoBERT for Indonesian Hoax Detection with Stance-Aware Multi-Task Learning — Gap: Sentiment (UB 2026) + stance detection + fact-checking; multi-task hoax detection is a gap.
- Self-Supervised Pretraining of Indonesian BERT on Domain-Specific Corpora with Limited Compute — Gap: Pretraining from scratch (rather than fine-tuning) for Indonesian under compute constraints.
- HDBSCAN for Log Pattern Discovery in Indonesian E-Government Systems — Gap: Cyber log clustering (UB 2026) applied to Indonesian e-government security; practical deployment gap.
- Multilingual Emotion Recognition in Indonesian YouTube Comments Using Cross-Lingual Embeddings — Gap: Emotion detection (UB 2026) on YouTube; code-mixed content with Indonesian/English is a gap.
- Incremental Fine-Tuning of Indonesian BERT for Evolving News Classification — Gap: BERT classification (Tirana 2024) is static; dynamic fine-tuning for evolving news topics is a gap.
- RoBERTa with Contrastive Learning for Indonesian Stance Detection in Social Media Debates — Gap: RoBERTa emotion (2026) can extend to stance detection; contrastive learning for stance is a gap.
- Indonesian Chatbot for Mental Health Support Using BERT2BERT with Empathetic Response Generation — Gap: BERT2BERT (UB 2024) + emotion (2026); empathetic mental health chatbot for Indonesian is a gap.
- Zero-Shot Indonesian Intent Classification Using Multilingual LLMs with Chain-of-Thought Prompting — Gap: Limited data NLP (Tirana 2026) for intent classification; zero-shot with CoT prompting is a gap.
- End-to-End Indonesian BERT Fine-Tuning Pipeline: From Preprocessing to Deployment — Gap: Tirana’s BERT classification thesis (2024) focuses on comparison; an end-to-end pipeline with best practices is a gap.
📚 Surveys (Tirana-Aligned)
- Indonesian LLM Evaluation: A Systematic Survey of Benchmarks and Datasets — Gap: Indonesian LLM evaluation survey (Tirana 2026 query); no comprehensive survey exists for Indonesian.
- BERT for Clinical Text in Low-Resource Languages: A Survey with Focus on Indonesian Healthcare — Gap: BERT clinical survey (Tirana 2026); Indonesian healthcare NLP survey is missing.
- Deep Learning for Cybersecurity in Indonesia: A Systematic Literature Review — Gap: Cyber DL survey (Tirana 2026); Indonesia-specific cybersecurity DL survey is absent.
- Low-Resource Language Fine-Tuning: Methods, Challenges, and Opportunities — A Survey — Gap: Low-resource fine-tuning survey (Tirana 2026) but no survey focuses on Indonesian/Malay languages.
- Deep Learning for Text Emotion Recognition: A Comprehensive Survey with a Low-Resource Perspective — Gap: Emotion DL survey (Tirana 2026) covers English; low-resource perspective is a gap.
- From BERT to LLMs: The Evolution of Indonesian NLP — A Survey (2020-2026) — Gap: UB theses track Indonesian NLP evolution but no comprehensive survey covers the transition.
- Parameter-Efficient Fine-Tuning of Transformer Models: A Survey for Low-Resource NLP — Gap: PEFT for low-resource NLP is a fast-growing field; no survey focuses on under-represented languages.
- Federated Learning for NLP in Southeast Asia: Challenges and Opportunities — Gap: Federated NLP for low-resource SEA languages lacks a dedicated survey.
- XAI for Text Classification: A Survey of Explanation Methods for BERT and Beyond — Gap: Explainable BERT (Tirana 2026 query) for text classification; no survey comprehensively covers XAI for BERT.
- Clustering Algorithms for Cybersecurity Log Analysis: A Survey and Benchmark — Gap: HDBSCAN for cyber (UB 2026) motivates a broader survey of clustering methods for security logs.