{"as_of":"2026-08-18T10:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2196b807dbac56a1f28c5cc9a32d2b2920129f0d40cbaf4d75af16574846e782","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:27:30.556529Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:27:26.864720Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:27:31.120281Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"cited_work":{"arxiv_id":"2505.24493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24493","snapshot_observed_at":"2026-08-07T12:27:31.120281Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","venue":"cs.AI","work_id":"e275eec3-894f-4714-a779-bdad660e4187","year":2025},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:26.864720Z"},"links":{"cited_paper":"/paper/2505.24493","citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:6534f6fbb0c37b5b057c098a9d307c506a0df181007dc9d50c5790dae0bb2432","observation_id":"402ac5de-66b2-4199-bf35-69f4371c4609","resolution":{"observed_at":"2026-08-07T12:27:31.225846Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24493/citation-record","integrity":"/paper/2505.24493/integrity","json":"/paper/2505.24493/citation-record.json","paper":"/paper/2505.24493"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"cited_work":{"arxiv_id":"2505.24493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24493","snapshot_observed_at":"2026-08-07T12:27:31.120281Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","venue":"cs.AI","work_id":"e275eec3-894f-4714-a779-bdad660e4187","year":2025},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:26.864720Z"},"links":{"cited_paper":"/paper/2505.24493","citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:6534f6fbb0c37b5b057c098a9d307c506a0df181007dc9d50c5790dae0bb2432","observation_id":"402ac5de-66b2-4199-bf35-69f4371c4609","resolution":{"observed_at":"2026-08-07T12:27:31.225846Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.718589Z","title":"1st Customer","venue":null,"work_id":"de35e4b0-7425-4c1c-8bbc-cdbf9b5f3f20","year":2024},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:26.942234Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:a694d2016f6a452629c22068f23e810a5a6e3accc25b257040205bf78e51c68f","observation_id":"0a6528c0-cd32-4f50-9cfd-fd596d54520c","resolution":{"observed_at":"2026-08-07T12:27:34.805142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.565521Z","title":"Emo Prediction","venue":null,"work_id":"4cb0cf38-35b2-42fd-8c42-9bd40dd79b27","year":null},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.087019Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:a903a0ce93a2d99ff5e26c4b5ae7fecb8e64163fd50e18bb26e23de9efb0c56b","observation_id":"633642c8-a18f-4dbf-bec1-c711c7d9406c","resolution":{"observed_at":"2026-08-07T12:27:34.608199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9460.19260","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:30.964968Z","title":"Subjective Experiment To assess the emotion annotation quality, we invited 20 par- ticipants, comprising 11 males and 9 females to conduct a Mean Opinion Score (MOS) experiment","venue":null,"work_id":"90ca2e62-93a4-465c-ba9c-2901acf809da","year":null},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.228099Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:02e54494ac7b785a8a961a8ebd329ef9b61f6d6e615d0f95cb43538da4a1fb90","observation_id":"26ad3144-fb9d-4890-a481-7c9e6c2b4a38","resolution":{"observed_at":"2026-08-07T12:27:31.044694Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.450005Z","title":"Performance The overall MOS result is shown in Fig","venue":null,"work_id":"8bf75b9b-3847-4399-ba51-1452e51016b8","year":null},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.361044Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:9d85099781e86f8b9c6e55e823104f332c6f62ff292cb166528eeee5d1f688a1","observation_id":"77a5abfc-b9ba-4998-a0a1-536b1eb404c4","resolution":{"observed_at":"2026-08-07T12:27:34.513190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.305932Z","title":"To achieve this, we developed a prompting strategy incorporating cross-validation and CoT rea- soning to ensure consistent and accurate annotations","venue":null,"work_id":"3aca673c-2954-49c1-90a6-4b1b0258b515","year":null},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.428756Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:e78e4a164b31183089cdeb51e493002e0c21cb02168cf25e22b65e1f8645b442","observation_id":"2870d4d2-c87c-4e41-b056-05e6767a9f00","resolution":{"observed_at":"2026-08-07T12:27:34.373866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.143135Z","title":"Schuller is also with the Munich Data Science Insti- tute and the Konrad Zuse School of Excellence in Reliable AI, both in Munich, Germany","venue":null,"work_id":"e16f3ca5-c964-483d-888f-9de19e4904e3","year":null},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.498174Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:c8c7368f144540267af0cec76f2ffb0251d9c2010f842ad924ddddfb2103b765","observation_id":"40bc5abf-dbd0-4a94-9992-2aad67ef0218","resolution":{"observed_at":"2026-08-07T12:27:34.233138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.970013Z","title":"Be- yond deep learning: Charting the next frontiers of affective com- puting,","venue":null,"work_id":"7b67aaf4-fdd7-45cc-8690-879a80941e0f","year":2024},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.560638Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:9b6904a43ade1f362b7bef557543df4f7f8442c45997bf546f4ca8a157f5b4b9","observation_id":"67387979-9e87-4696-b7c9-e968f89b0446","resolution":{"observed_at":"2026-08-07T12:27:34.043674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.807625Z","title":"En- hancing emotional text-to-speech controllability with natural lan- guage guidance through contrastive learning and diffusion mod- els,","venue":null,"work_id":"db3bc779-e26f-42e9-8550-e78b8062c112","year":2025},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.677962Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:b70cb906d6008169f950348abb83946b891b750d91feeed187c9bd93d724d242","observation_id":"3f2e4355-2c90-4e2f-b94c-a6a4d105c234","resolution":{"observed_at":"2026-08-07T12:27:33.903281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.650672Z","title":"Emotion recognition in context,","venue":null,"work_id":"234d3b31-533f-4c2d-adab-f8014764f981","year":2017},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.799259Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:6b67b5e72d084e79e0faa3e802908e7273c5b765ba16689cebcbfaa7f2978d9b","observation_id":"c5e9f569-d767-4100-bfc5-57040ed1b31d","resolution":{"observed_at":"2026-08-07T12:27:33.725487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08992","last_updated":"2025-01-31T18:53:30Z","snapshot_observed_at":"2026-08-16T13:52:39.539850Z","submitted_at":"2024-05-14T23:24:12Z","title":"Contextual Emotion Recognition using Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08992","snapshot_observed_at":"2026-08-07T12:27:27.873897Z","title":"Contextual emotion recognition using large vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.873897Z"},"links":{"cited_paper":"/paper/2405.08992","citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:64c41bc662d509dc87c64b65f73361fc3f17ded4242919b89b79340febab0ae0","observation_id":"feafe0e5-f059-4a73-84ab-a7cc6783b03b","resolution":{"observed_at":"2026-08-07T12:27:27.873897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.477167Z","title":"The human in emotion recognition on social media: Attitudes, outcomes, risks,","venue":null,"work_id":"234061be-2943-4d77-bdf2-798175cb3fee","year":2020},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.960259Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:a4c59a01b8663751c4939d03b51e66ae7d61cd175fd1b157ef7f3f9fd4942215","observation_id":"a8eff7a5-9bcd-4917-a2c1-47ab01bb0441","resolution":{"observed_at":"2026-08-07T12:27:33.548809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.088535Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.088535Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:f5105c487f85f952e1ef39af0b1328887b6789859b2a91d6869e16c5eaa9760e","observation_id":"e6423b5b-6bd8-4dc8-96b2-940c3cc04980","resolution":{"observed_at":"2026-08-07T12:27:28.088535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T12:27:28.164916Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.164916Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:232dec8acc3e0df782d1ee1008a3221f420a7c16077fd13bec8fd47992963d6d","observation_id":"c4c1fadf-d6eb-4ee0-b898-87f0b163e5a7","resolution":{"observed_at":"2026-08-07T12:27:28.164916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:27:28.249407Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.249407Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:22d596d11030da1173b623a6f9a18b161671c9c919b5971b20e5bd8e24584b6f","observation_id":"507770af-6dac-4c0d-b692-82ef45a2283f","resolution":{"observed_at":"2026-08-07T12:27:28.249407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13446","last_updated":"2024-12-02T20:55:15Z","snapshot_observed_at":"2026-08-18T07:59:09.732647Z","submitted_at":"2024-02-21T00:44:04Z","title":"Large Language Models for Data Annotation and Synthesis: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13446","snapshot_observed_at":"2026-08-07T12:27:28.359993Z","title":"Large language models for data annotation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.359993Z"},"links":{"cited_paper":"/paper/2402.13446","citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:1af83bde266e3afbade49796a09f55230b0bf83a3234ee95cc284da918312059","observation_id":"24e35159-b0a7-4c28-9c50-f89fddd93f71","resolution":{"observed_at":"2026-08-07T12:27:28.359993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.349623Z","title":"Chatgpt vs. human annotators: A comprehen- sive analysis of chatgpt for text annotation,","venue":null,"work_id":"93b0b156-39f4-4f22-bb95-7db332dc0515","year":2023},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.424390Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:7120da9b9ecfe6610563a2abcb793d3f6b67d859e7c7d01acc34e15adb4efb25","observation_id":"5b00d479-fa07-4bc1-8d12-dd421f3e78cf","resolution":{"observed_at":"2026-08-07T12:27:33.412896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.187370Z","title":"Chatgpt outperforms crowd workers for text-annotation tasks,","venue":null,"work_id":"7267399c-d473-4b31-8bb3-5c4752a31a4b","year":2023},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.492592Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:14d220f17ed3c04f240d410c86ad9db9b7191fcda792e34f970b9e0d344ee516","observation_id":"2b63ef89-f5eb-45c1-9b2a-d360e614254f","resolution":{"observed_at":"2026-08-07T12:27:33.259232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.021451Z","title":"Wavcaps: A chatgpt-assisted weakly- labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"1dcd47f8-a404-45c5-85cc-a035c47e6c62","year":2024},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.583808Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:8fb44d06d3e00a9e3c3b7162f5a0b4e8f1dcf0d8696931964c9cc0e3f8f81237","observation_id":"bc585383-0a91-4d08-9cc7-15eb89bb6556","resolution":{"observed_at":"2026-08-07T12:27:33.108845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.671061Z","title":"Pengi: An audio language model for audio tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.671061Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:a615a25b1b598db4af859d7f531b777cd319b74a533295111a3cc7181bbca047","observation_id":"a3d040bf-46f1-4e6d-bd62-7a2bc5540e12","resolution":{"observed_at":"2026-08-07T12:27:28.671061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.818603Z","title":"Secap: Speech emotion captioning with large language model,","venue":null,"work_id":"1a7dc19e-15c5-4422-818c-a4c50915c8d1","year":2024},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.759546Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:a80286267b7fe0624af843f598e0d45e4ebea184f07821529d63a04d1811a283","observation_id":"bb199048-d0c0-410e-a418-3b9cbe7bbb88","resolution":{"observed_at":"2026-08-07T12:27:32.890406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:27:28.833637Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.833637Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:3e86752ce2aa2a6ded474edcc3b437fb097da035404004786ea97fd169b690c8","observation_id":"829657dd-f225-475a-a7ac-269940d2f011","resolution":{"observed_at":"2026-08-07T12:27:28.833637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.621176Z","title":"Meld: A multimodal multi-party dataset for emo- tion recognition in conversations,","venue":null,"work_id":"dba43208-856d-4721-b7b6-032484cd2afd","year":2019},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.903608Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:d472b7f4210e5151403e6b7a6789c0b5c443af1cb257f1ec98f3a3d380b2e187","observation_id":"cb9d5785-08b4-4876-b801-17776bf9b817","resolution":{"observed_at":"2026-08-07T12:27:32.684728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.363434Z","title":"On the time course of vocal emotion recognition,","venue":null,"work_id":"ceedfc1f-cd14-4678-a8f5-90d1ddf78f63","year":2011},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.042826Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:d2f3449d6a7982f796871b4c44b8b62e7d1fff6f0c22af25d1ff0a3dc7967367","observation_id":"e304351d-024f-49df-a304-ea7058bb1faa","resolution":{"observed_at":"2026-08-07T12:27:32.534749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.166985Z","title":"Applying tdnn architectures for an- alyzing duration dependencies on speech emotion recognition","venue":null,"work_id":"9cc6794e-afcb-4965-ac66-5e683bf51f59","year":2021},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.117137Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:cc10db9bc280286395e535a762c781b0ab95ca0101ab79727255dad44b05d17a","observation_id":"81739cf6-dc75-4887-9ef3-f7b436edad95","resolution":{"observed_at":"2026-08-07T12:27:32.234416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.995125Z","title":"A wide evaluation of chatgpt on affective computing tasks,","venue":null,"work_id":"f1fcf740-4cf6-4a98-940d-cbeca5f59aff","year":2024},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.189552Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:78ac727b740a995cbf7e793588070ef7dfc84f579cb8701f8127c0535f1f2afb","observation_id":"dd452cb9-5977-497a-9524-dcdbe58347ed","resolution":{"observed_at":"2026-08-07T12:27:32.062542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.295963Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.295963Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:44623bd050ebb5ad1e559501a7efd297ea75665adbb66e1478430f795118ba62","observation_id":"8a311e23-6e8a-4094-aeec-2a6c6432be05","resolution":{"observed_at":"2026-08-07T12:27:29.295963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.431282Z","title":"Dawn of the trans- former era in speech emotion recognition: closing the valence gap,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.431282Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:d9147deda7ebef7bc609055b5e5b0f26c4d21bbbdcf97c7f7ea7975d96ef8d69","observation_id":"64cdf607-ff54-4605-a33a-0040025a012e","resolution":{"observed_at":"2026-08-07T12:27:29.431282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.512545Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.512545Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:ee3b229ed9c7c53f5370192d9efa14745802f2ff854e2ee52bb7ee2148bea711","observation_id":"d0c74c29-d9fe-4bd8-abe6-0afdd43d52d7","resolution":{"observed_at":"2026-08-07T12:27:29.512545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.656517Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.656517Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:7c5fc34b113b9a2f97e24a80f494102f9f5c103184dee7261649fc1f8ee3092a","observation_id":"7dd3754d-f5d6-4243-b857-115f071b1fed","resolution":{"observed_at":"2026-08-07T12:27:29.656517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.800246Z","title":"Iemocap: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.800246Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:3aeecedd63c234f6a7979648f482e4cf2f49c5fc341dd28802c48cf0d6b17e55","observation_id":"58958196-2d1a-4589-9851-37059db372d5","resolution":{"observed_at":"2026-08-07T12:27:29.800246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.942112Z","title":"Toronto emotional speech set (tess)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.942112Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:936d075a0083d14b1d22f8c334ce1c86417e9e24a6968bf55550ea03a6988bad","observation_id":"77085dc2-383e-455c-b349-9bcb8a4a2a87","resolution":{"observed_at":"2026-08-07T12:27:29.942112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:30.046700Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.046700Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:52a5a131553bce0f8652e9a61b850593bb0f720282ba3ea7d9443b583d6fe9ea","observation_id":"a5a16bbb-10cf-4525-9873-a9418b6712ab","resolution":{"observed_at":"2026-08-07T12:27:30.046700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:30.136880Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.136880Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:135ccbded65888d6b312a210c5ed485e26b33e1e8dcda0f16a55c49c418f5c40","observation_id":"66577d96-c517-4924-aeb0-82a1de589378","resolution":{"observed_at":"2026-08-07T12:27:30.136880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13018","last_updated":"2024-03-12T07:13:02Z","snapshot_observed_at":"2026-08-16T14:16:56.732620Z","submitted_at":"2024-02-20T14:00:53Z","title":"EMO-SUPERB: An In-depth Look at Speech Emotion Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13018","snapshot_observed_at":"2026-08-07T12:27:30.198470Z","title":"Emo-superb: An in-depth look at speech emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.198470Z"},"links":{"cited_paper":"/paper/2402.13018","citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:729891a7e10764c9b5fc08578461607b7db3aa17f9cb49ca13277f047ce0816b","observation_id":"c35b71e7-64cb-4d7c-9fe7-cb23a372826d","resolution":{"observed_at":"2026-08-07T12:27:30.198470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.777946Z","title":"Paraclap– towards a general language-audio model for computational par- alinguistic tasks,","venue":null,"work_id":"cfd33a8c-80ed-4d67-8b28-bea5abb50624","year":2024},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.294929Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:e5db216d6564e56191a56c313983c0eba63c266f74b85e233524a4f5a18efab4","observation_id":"bd2260ac-bae1-4883-9ce6-16fcdbcefecc","resolution":{"observed_at":"2026-08-07T12:27:31.857628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:30.409565Z","title":"The geneva minimalistic acoustic parameter set (gemaps) for voice research and affective computing,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.409565Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:9717f0980e977cc4c6a2f4656e4a81614e10748b1dd7d5b858427e5f0508a77d","observation_id":"a0867d04-8d09-4afa-88d6-ba04896c76f8","resolution":{"observed_at":"2026-08-07T12:27:30.409565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.597038Z","title":"openSMILE: the Munich versatile and fast open-source audio feature extractor,","venue":null,"work_id":"447c6e30-28ef-41c9-9668-9aa5749ae0a4","year":2010},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.481144Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:d6290054623b0372bead5d6a30395ac46c68a71089130c6b19eccbb8d0494fe1","observation_id":"75f7473e-3a93-4c5f-b694-1ce0eeedf5b5","resolution":{"observed_at":"2026-08-07T12:27:31.684716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.370590Z","title":"How do we describe other people from voices and faces?","venue":null,"work_id":"2ac76242-a342-4feb-ad45-eeef2b76ea44","year":2023},"citing_paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.556529Z"},"links":{"citing_paper":"/paper/2505.24493"},"observation_digest":"sha256:b887f5e4858bdd879d395ea584e1c056031ff2ac4935e4b73208d020fa28eca8","observation_id":"d99fd321-fc6d-4b52-aa62-e1f19f317c61","resolution":{"observed_at":"2026-08-07T12:27:31.467360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24493","last_updated":"2025-05-30T11:45:36Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T08:04:31.450488Z","submitted_at":"2025-05-30T11:45:36Z","title":"MELT: Towards Automated Multimodal Emotion Data Annotation by Leveraging LLM Embedded Knowledge"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2505.24493."}