<?xml version="1.0" encoding="UTF-8"?>
<record
    xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
    xsi:schemaLocation="http://www.loc.gov/MARC21/slim http://www.loc.gov/standards/marcxml/schema/MARC21slim.xsd"
    xmlns="http://www.loc.gov/MARC21/slim">

  <leader>05166nas a2200397 a 4500</leader>
  <controlfield tag="005">20260819085037.0</controlfield>
  <controlfield tag="008">260219s20259999th u  ms t    000   eng d</controlfield>
  <datafield tag="035" ind1=" " ind2=" ">
    <subfield code="a">.b12478088</subfield>
  </datafield>
  <datafield tag="099" ind1=" " ind2="9">
    <subfield code="a">AIT Diss. no.CS-25-01</subfield>
  </datafield>
  <datafield tag="100" ind1="1" ind2=" ">
    <subfield code="a">Jednipat Moonrinta</subfield>
  </datafield>
  <datafield tag="245" ind1="1" ind2="0">
    <subfield code="a">Transformer-based aggregation for sequential face recognition</subfield>
  </datafield>
  <datafield tag="260" ind1=" " ind2=" ">
    <subfield code="a">Pathum Thani, Thailand :</subfield>
    <subfield code="b">Asian Institute of Technology,</subfield>
    <subfield code="c">2025</subfield>
  </datafield>
  <datafield tag="300" ind1=" " ind2=" ">
    <subfield code="a">152 leaves :</subfield>
    <subfield code="b">ill. +</subfield>
    <subfield code="e">1 online resource</subfield>
  </datafield>
  <datafield tag="490" ind1="1" ind2=" ">
    <subfield code="a">Dissertation ;</subfield>
    <subfield code="v">no. CS-25-01</subfield>
  </datafield>
  <datafield tag="500" ind1=" " ind2=" ">
    <subfield code="a">A dissertation submitted in partial fulfillment of the requirements for the degree of Doctor of Philosophy in Computer Science</subfield>
  </datafield>
  <datafield tag="502" ind1=" " ind2=" ">
    <subfield code="a">Thesis (Ph.D.) - Asian Institute of Technology, 2025</subfield>
  </datafield>
  <datafield tag="520" ind1=" " ind2=" ">
    <subfield code="a">In the past decade, advancements in face recognition have achieved accuracy levels com parable to human performance. The most effective models perform face embedding, in  which a cropped face image is projected into a vector space in a way that embeddings of  the same individual{u2019}s face under different imaging conditions tend to lie close together,  and embeddings of different individuals{u2019} faces tend to lie far apart. Face embedding models developed using machine learning have driven success in various real-world applications such as face verification for authentication. However, these systems typically  require high-quality input images for both gallery and probe samples, an assumption that  does not always hold in real-world scenarios. Variations in image quality, illumination,  face pose, and occlusions can significantly affect performance. To address the challenge of noisy face embeddings caused by inconsistent image quality,  we propose a deep learning-based approach that aggregates multiple face embeddings,  either sequential or non-sequential, to construct a more robust face representation for  verification.First, we develop a Transformer-based model that processes face embeddings extracted  from a high-performance face feature extractor. The model takes a batch of embeddings as input and generates a refined face representation for verification.Second, we introduce an adaptive triplet loss function that extends the traditional triplet  loss function for face embedding models by applying separate margin thresholds for  positive and negative pairs. We evaluate both fixed margins and dynamically adjusted  margins that adapt to the data on the fly. The adaptive triplet loss mitigates excessive penalization of differences between positive pairs and similarities between negative pairs.Third, we implement a two-stage training strategy comprising pre-training and fine tuning phases. In the pre-training phase, the model is trained using root mean squared  loss to produce embeddings similar to those obtained via average pooling. In the fine tuning phase, the above-mentioned adaptive triplet loss is employed to further refine the  model. In a series of experiments, we train our proposed model using this two-stage training  approach on the YouTubeFaces dataset and evaluate its performance on multiple benchmark datasets, including IMFDB, CASIA-WebFace, CCVID, IJB-B, and IJB-C.The experimental results demonstrate that our method outperforms the baseline on most  datasets. Our model generalizes well to unseen datasets and performs exceptionally well on the IMFDB dataset, where significant variations exist in face pose, lighting condi tions, and scene contexts within a single identity.Furthermore, to assess the model{u2019}s effectiveness in real-world deployment, we integrate  our Transformer-based aggregation model into an elder care scenario using a telehealth  dataset. In this setting, the model must verify individuals using video sequences captured in uncontrolled environments, with natural lighting, and high face pose variations. Our method shows improvement over the average pooling baseline. This confirms the practical utility of our approach for improving face verification reliability in challenging real-world conditions. We conclude that the methodology is an effective way to exploit  the availability of multiple images of an individual when performing face verification  under adverse conditions.</subfield>
  </datafield>
  <datafield tag="650" ind1=" " ind2="0">
    <subfield code="a">Human face recognition (Computer science)</subfield>
  </datafield>
  <datafield tag="650" ind1=" " ind2="0">
    <subfield code="a">Human-computer interaction</subfield>
  </datafield>
  <datafield tag="650" ind1=" " ind2="0">
    <subfield code="a">Computer vision</subfield>
  </datafield>
  <datafield tag="700" ind1="1" ind2=" ">
    <subfield code="a">Dailey, Mathew N.,</subfield>
    <subfield code="e">Chairperson</subfield>
  </datafield>
  <datafield tag="700" ind1="0" ind2=" ">
    <subfield code="a">Huynh, Trung Luong,</subfield>
    <subfield code="e">Examination Committee</subfield>
  </datafield>
  <datafield tag="700" ind1="0" ind2=" ">
    <subfield code="a">Chaklam Silpasuwanchai,</subfield>
    <subfield code="e">Examination Committee</subfield>
  </datafield>
  <datafield tag="700" ind1="0" ind2=" ">
    <subfield code="a">Adisorn Lertsinsrubtavee,</subfield>
    <subfield code="e">Examination Committee</subfield>
  </datafield>
  <datafield tag="710" ind1="2" ind2=" ">
    <subfield code="a">Royal Thai Government,</subfield>
    <subfield code="e">Scholarship Donor</subfield>
  </datafield>
  <datafield tag="710" ind1="2" ind2=" ">
    <subfield code="a">AIT Fellowship,</subfield>
    <subfield code="e">Scholarship Donor</subfield>
  </datafield>
  <datafield tag="810" ind1="2" ind2=" ">
    <subfield code="a">Asian Institute of Technology.</subfield>
    <subfield code="t">Dissertation ;</subfield>
    <subfield code="v">no. CS-25-01</subfield>
  </datafield>
  <datafield tag="856" ind1="4" ind2="0">
    <subfield code="3">Full-Text</subfield>
    <subfield code="u">http://203.159.5.9/ait-thesis/Viewer/viewer.php?id=B23605</subfield>
  </datafield>
  <datafield tag="907" ind1=" " ind2=" ">
    <subfield code="a">.b12478088</subfield>
    <subfield code="b">mnarc</subfield>
    <subfield code="c">a</subfield>
  </datafield>
  <datafield tag="902" ind1=" " ind2=" ">
    <subfield code="a">260227</subfield>
  </datafield>
  <datafield tag="998" ind1=" " ind2=" ">
    <subfield code="b">0</subfield>
    <subfield code="c">260226</subfield>
    <subfield code="d">m</subfield>
    <subfield code="e">h  </subfield>
    <subfield code="f">a</subfield>
    <subfield code="g">0</subfield>
  </datafield>
  <datafield tag="945" ind1=" " ind2=" ">
    <subfield code="l">mnarc</subfield>
  </datafield>
  <datafield tag="942" ind1=" " ind2=" ">
    <subfield code="c">67</subfield>
  </datafield>
  <datafield tag="909" ind1=" " ind2=" ">
    <subfield code="a">Barcode : -</subfield>
    <subfield code="b">CREATED : 2026-02-19</subfield>
    <subfield code="c">RECORD # : i13575016</subfield>
    <subfield code="d">LPATRON : 0</subfield>
    <subfield code="e">LCHKIN : -</subfield>
    <subfield code="f"># RENEWALS : 0</subfield>
    <subfield code="g"># OVERDUE : 0</subfield>
    <subfield code="h">IUSE3 : 0</subfield>
    <subfield code="i">TOT CHKOUT : 0</subfield>
    <subfield code="j">TOT RENEW : 0</subfield>
  </datafield>
  <datafield tag="999" ind1=" " ind2=" ">
    <subfield code="c">122420</subfield>
    <subfield code="d">122420</subfield>
  </datafield>
  <datafield tag="952" ind1=" " ind2=" ">
    <subfield code="0">0</subfield>
    <subfield code="1">0</subfield>
    <subfield code="4">0</subfield>
    <subfield code="7">0</subfield>
    <subfield code="a">MAIN</subfield>
    <subfield code="b">MAIN</subfield>
    <subfield code="c">mnarc</subfield>
    <subfield code="d">2026-08-19</subfield>
    <subfield code="l">0</subfield>
    <subfield code="o">AIT Diss. no.CS-25-01</subfield>
    <subfield code="r">2026-08-19 08:50:37</subfield>
    <subfield code="t">1</subfield>
    <subfield code="w">2026-08-19</subfield>
    <subfield code="y">67</subfield>
  </datafield>
</record>
