Yuan Sun(孙 媛)
Professor
National Language Resource Monitoring & Research Center of Minority Language
Minzu Unversity of China
Location: 27 Zhongguancun South Avenue Beijing, China
Research Interest | Education | Work Experience | Honors and Awards | Reserach Projects | Publications | Patents | Corpora |
Email: tracy.yuan.sun@gmail.com (prior);      sunyuan@muc.edu.cn
[ORCID]

Research Interest

I work in the field of Natural language processing. Currently, I focus on the following research topics:

Education

Work Experience

Honors and Awards

Research Projects

Publications

Books:

Yuan Sun. Status Survey on Social Awareness and Usage of Tibetan New Words and Terms. Minzu University of China Press, Beijing, China, 2019.


Papers:

    [1]   Wenhao Zhuang, Yuan Sun*. CUTE: A Multilingual Dataset for Enhancing Cross-Lingual Knowledge Transfer in Low-Resource Languages. Proceedings of the 31st International Conference on Computational Linguistics (COLING), 2025, pp. 10037–10046.

    [2]   Yijie Li, Yuan Sun*. EasyJudge: an Easy-to-use Tool for Comprehensive Response Evaluation of LLMs. Proceedings of the 31st International Conference on Computational Linguistics: System Demonstrations (COLING), 2025, pp. 91–103.

    [3]   Xi Cao, Yuan Sun*, Quzong Gesang, Nuo Qun*, Nyima Tashi. TSCheater: Generating High-Quality Tibetan Adversarial Texts via Visual Similarity. Proceedings of the 50th IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2025.

    [4]   Yuan Sun, Yan Zhuang, Sisi Liu, Xiaobing Zhao. Tibetan Question Generation Based on Key Sentence and Knowledge Graph. ACM Transactions on Asian and Low-Resource Language Information Processing (TALLP), 2025.

    [5]   Zhengcuo Dan, Yuan Sun*. TibetanQA2.0: Dataset with Unanswerable Questions for Tibetan Machine Reading Comprehension. Data Intelligence, 2024.

    [6]   Wenhao Zhuang, Dawa Cairen, Yuan Sun*. TIFD: Tibetan Instruction-Following Dataset for Large Language Models Supervised Fine-Tuning. Data Intelligence, 2024.

    [7]   Pengmao Cairang, Dawa Cairen, Yuan Sun*. TiconvQA: A Tibetan Conversational Dataset for Text Comprehension. Data Intelligence, 2025.

    [8]   Long Chen, Yuan Sun*. Dataset Used for Reinforcement Learning Tasks of Tibetan Large Models. Data Intelligence, 2025.

    [9]   Jian Luo, Yuan Sun*. A Dataset of Mongolian Reward Training QA. Data Intelligence, 2025.

    [10]   Yijie Li, Yuan Sun*. AlpaCream: an Effective Method of Data Selection on Alpaca. IEEE International Conference on Systems, Man, and Cybernetics (SMC), 2024.

    [11]   Ruihui Wang, Hongying He, Yuan Sun*. Cybernetic Sentinels: Unveiling the Impact of Safety Data Selection on Model Security in Supervised Fine-Tuning. International Conference on Intelligent Computing (ICIC), 2024.

    [12]   Wenhao Zhuang, Dawa Cairen, Pengmao Cairang, Yuan Sun*. Tibetan-Chinese Machine Translation Evaluation Technical Report. CCMT2024.

    [13]   Wenhao Zhuang, Ge Gao, Yuan Sun*. TiKG-30K: A Tibetan Knowledge Graph Dataset Based on Representation Learning. The 22nd China National Conference on Computational Linguistics (CCL), 2023.

    [14]   Junjie Deng, Long Chen, Ting Zhang, Yuan Sun*, Xiaobing Zhao. TiKEM: Knowledge Enhanced Tibetan Pre-trained Language Model. The 22nd China National Conference on Computational Linguistics (CCL), 2023.

    [15]   Zhengcuo Dan, Long Chen, Junjie Deng, Xian Pang, Yuan Sun*. Difficult Question Generation of Tibetan Machine Reading Based on Data Enhancement. The 22nd China National Conference on Computational Linguistics (CCL), 2023.

    [16]   Junjie Deng, Hanru Shi, Xinhe Yu, Wugedele Bao, Yuan Sun*, Xiaobing Zhao. MiLMo: Minority Multilingual Pre-trained Language Model. IEEE International Conference on Systems, Man, and Cybernetics (SMC), 2023.

    [17]   Yuan Sun*, Sisi Liu, Zhengcuo Dan, Xiaobing Zhao. Question Generation Based on Grammar Knowledge and Fine-grained Classification. Proceedings of the 29th International Conference on Computational Linguistics (COLING), 2022, pp. 6457–6467.

    [18]   Sisi Liu, Junjie Deng, Yuan Sun*, Xiaobing Zhao. TiBERT: Tibetan Pre-trained Language Model. IEEE International Conference on Systems, Man, and Cybernetics (SMC), 2022, pp. 2956-2961.

    [19]   Sisi Liu, Chaofan Chen, Yuan Sun*. Paragraph-level Tibetan Question Generation for Machine Reading Comprehension. International Conference on Asian Language Processing (IALP), 2022, pp. 280-285.

    [20]   Yuan Sun*, Andong Chen, Chaofan Chen, Tianci Xia, Xiaobing Zhao. A Joint Model for Representation Learning of Tibetan Knowledge Graph Based on Encyclopedia. ACM Transactions on Asian and Low-Resource Language Information Processing, Vol. 20, No. 2, Article 27, 2021, pp 1–17.

    [21]   Yuan Sun*, Chaofan Chen, Andong Chen, Xiaobing Zhao. Tibetan Question Generation Based on Sequence to Sequence Model. CMC: Computers, Materials & Continua, 2021, 68(3): 3203–3213.

    [22]   Yuan Sun*, Sisi Liu, Chaofan Chen, Zhengcuo Dan, Xiaobing Zhao. Construction of High-quality Tibetan Dataset for Machine Reading Comprehension. The 20th China National Conference on Computational Linguistics (CCL), 2021.

    [23]   Yuan Sun*, Chaofan Chen, Sisi Liu, Xiaobing Zhao. Ti-Reader: An End-to-End Network Model Based on Attention Mechanisms for Tibetan Machine Reading Comprehension. The 20th China National Conference on Computational Linguistics (CCL), 2021.

    [24]   Yuan Sun*, Jiaya Liang, Andong Chen, Xiaobing Zhao. JCapsR: A Joint Capsule Neural Network for Tibetan Knowledge Graph Representation Learning. The 20th China National Conference on Computational Linguistics (CCL), 2021.

    [25]   Like Wang, Yuan Sun*, Sisi Liu. Tibetan Entity Relation Extraction Based on Multi-level Attention Fusion Mechanism. Chinese Journal of Intelligent Science and Technology, 2021, 3(04): 466-473.

    [26]   Yuan Sun*, Sisi Liu, Tianci Xia and Xiaobing Zhao. An End-to-End Method for Joint Extraction of Tibetan Entity Relations. Journal of Computer and Communications, 2021, pp. 132-142.

    [27]   Yuan Sun*, Jiaya Liang, Pengchao Niu. Personalized Recommendation of English Learning Based on Knowledge Graph and Graph Convolutional Network. International Conference on Artificial Intelligence and Security, 2021.

    [28]   Like Wang, Yuan Sun*, Tianci Xia, Distant Supervision for Tibetan Entity Relation Extraction. Journal of Chinese Information Processing, vol. 34, no.3, pp. 72-79, 2020.

    [29]   Yuan Sun*, Chaofan Chen, Tianci Xia, Xiaobing Zhao. QuGAN: Quasi Generative Adversarial Network for Tibetan Question Answering Corpus Generation. IEEE ACCESS, vol. 7, pp. 116247-116255, 2019.

    [30]   Tianci Xia, Yuan Sun*, Xiaobing Zhao, Wei Song, Yumiao Guo. Generating Questions Based on Semi-automated and End-to-End Neural Network. CMC: Computers, Materials & Continua, vol. 61, no. 2, pp.617-628, 2019.

    [31]   Yuan Sun*, Like Wang, Chaofan Chen, Tianci Xia, Xiaobing Zhao. Improved Distant Supervised Model in Tibetan Relation Extraction Using ELMo and Attention. IEEE ACCESS, vol. 7, pp. 173054-173062, 2019.

    [32]   Yuan Sun*, Wang Like, Guo Lili. Tibetan Entity Relation Extraction Based on Optimized Word Embedding with GRU Neural Network. Journal of Chinese Information Processing, vol. 33, no.6, pp. 35-41, 2019.

    [33]   Yuan Sun*, Tianci Xia. A Hybrid Network Model for Tibetan Question Answering. IEEE ACCESS, vol. 7, pp. 52769-52777, 2019.

    [34]   Pengchao Niu, Yuan Sun*, Wei Song, Shijiao Zhang. Evaluation Method of Teachers' Teaching Ability Based on BP Neural Network. The 5th International Conference on Artificial Intelligence and Security, New York, USA, pp. 27-38, 2019.

    [35] Hao Li, Yuan Sun*, Wei Song, Jie Qin. Research on the Promotion of Tibetan New Words and Platform Design. The 5th International Conference on Artificial Intelligence and Security, New York, USA, pp. 39-50, 2019.

    [36] Xia Tianci,Yuan Sun*. Tibetan Entity Relation Extraction Based on Joint Model. Journal of Chinese Information Processing, vol. 32, no.12, pp. 76-83, 2018.

    [37]   Like Wang, Yuan Sun*, Xiaobing Zhao. English-Chinese Cross Language Word Embedding Similarity Calculation. Artificial Intelligence and Cloud Computing Conference, Tokyo, Japan, 2018.

    [38]   Yuan Sun, Zhen Zhu. Template Construction and Tibetan Knowledge Extraction. International Conference on Artificial Intelligence and Big Data, Chengdu, China, 2018.

    [39]   Hao Li, Yuan Sun*. English Education Text Recommendation Technology based on Word Embedding. International Conference on Big Data and Artificial Intelligence, Beijing, China, 2018.

    [40]   Yuan Sun*, Zhao Qian. Research on the Extraction and Alignment of Tibetan-Chinese Cross-language Topics. Journal of Chinese Information Processing, vol. 31, no.1, pp. 102-111, 2017.

    [41]   Yuan Sun, Tibetan-Chinese Comparable Corpus Construction Based on Word Embedding an LDA Model, Journal of Residuals Science & Technology, 2016, 13(9): 271-279.

    [42]   Zhu Zhen, Yuan Sun*. Tibetan Person Attribute Extraction Based on SVM and Pattern. Journal of Chinese Information Processing, vol. 29, no.6, pp. 220-227, 2016.

    [43]   Lili Guo, Yuan Sun*. Tibetan Person Attributes Extraction Based on BP Neural Network. Chinese Computational Linguistics and Natural Language Processing Based on Naturally Annotated Big Data, Changsha, China, 2016.

    [44]   Yuan Sun, Zhao Qian. Tibetan-Chinese Cross Language Text Similarity Calculation Based on LDA Topic Model. The Open Cybernetics & Systemics Journal, vol. 9, pp. 2911-2919, 2015.

    [45]   Yuan Sun and Guo Wenbin. A Multi-Strategy Quantitative Analysis Model for Network Emergency. The Open Cybernetics & Systemics Journal, vol. 8, pp. 821-828, 2014.

    [46]   Yuan Sun, Wenbin Guo, Xiaobing Zhao. Tibetan-Chinese Cross Language Named Entity Extraction Based on Comparable Corpus and Naturally Annotated Resources. IEEE Symposium Series on Computational Intelligence, Rolando, USA, 2014.

    [47]   Yuan Sun and Guo Wenbin. Hot Word Extraction of Tibetan Internet Public Opinion. Information Technology Journal, vol.12, no. 20, pp. 5505-5511, 2013.

    [48]   Yuan Sun. Study on Tibetan New Word Extraction. Journal of Convergence Information Technology, vol. 8, no. 4, pp. 50-58, 2013.

    [49]   Yuan Sun. Research on Tibetan Automatic Word Segmentation. AISS: Advances in Information Sciences and Service Sciences, vol. 5, no. 5, pp. 726-734, 2013.

Patents

  • Yuan Sun. Method of Tibetan Entity Knowledge Information Extraction (No. ZL201410310710.4).
  • Yuan Sun. Method of Tibetan Entity Relation Extraction (No. ZL201510173998.X).
  • Yuan Sun. Zhao Qian. A Method and System on Cross-language Topic Detection (No. ZL201610507463.6)
  • Yuan Sun. Xia Tianci. A Generation Method of Low-resouce Language Question Answer Corpus (No. ZL201910501879.0)

Corpora

  • Word Segmentation Corpus includes 22,600 Tibetan sentences, 100,000 Uyghur sentences, 100,000 Mongolian sentences.
  • Tibetan POS Corpus includes 520,000 words.
  • Tibetan Entity Relation Corpus includes 10,000 sentences.
  • Tibetan Entity Knowledge Base includes 95,090 three tuples, 4,183 relations and 12,658 Tibetan encyclopedia data.
  • Tibetan Question Answering Corpus includes 21,783 pairs.