{"as_of":"2026-08-15T17:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1b933b346019f470bf34723dc8b4dc71b4e2b01e7ed4d9982acd113b866a6d6","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:38:01.992997Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.05558/citation-record","integrity":"/paper/2412.05558/integrity","json":"/paper/2412.05558/citation-record.json","paper":"/paper/2412.05558"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.791864Z","title":"Pattern recognition, 44(3):572–587 (2011)","venue":null,"work_id":"1390f490-a3af-433e-9add-33fa9ce7a3bd","year":2011},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.808303Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:1eb30ad0362d98f61b8783631cdc37547fe685cc925bab9ccadcd31f98804fb2","observation_id":"4b7eceb0-f550-487e-a270-1ebc06d8669b","resolution":{"observed_at":"2026-08-11T20:38:02.798188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.775174Z","title":"In 2021 7th International Conference on Computer and Communications (ICCC), pages 514–518 (2021)","venue":null,"work_id":"47e18983-4899-4281-a234-ecb22ae93ef1","year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.824900Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:dd035a48dfc629ec7dc65c618c7c7820ac0cfd678e646e60e5786d77122d1c4e","observation_id":"75c1d878-9e3e-4efc-b926-49b24acc88c6","resolution":{"observed_at":"2026-08-11T20:38:02.779794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.755236Z","title":"In Third international conference on natural computation (ICNC 2007), volume 5, pages 809–813 (2007)","venue":null,"work_id":"acac9ace-73b0-4400-a0c6-ed165e1594dc","year":2007},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.830165Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:b586d34146ac2620bf5397a896f43d4b6a891afa2630adfe84c040e6a6ec86ed","observation_id":"891e4fb8-ae2d-4add-a0a3-bc01825ea43a","resolution":{"observed_at":"2026-08-11T20:38:02.764821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.725104Z","title":"In 2022 IEEE 8th World Forum on Internet of Things (WF-IoT), pages 1–6 (2022)","venue":null,"work_id":"8ff01871-8c4f-4786-b50f-39c786878156","year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.840892Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:50035838b2b07045709b8f045cf9267eec7e57bf6385104eecf1d1a612a8f907","observation_id":"90355c7f-f9aa-42e6-97bf-fb0fcd779427","resolution":{"observed_at":"2026-08-11T20:38:02.731202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.700634Z","title":"In Applied Information Processing Systems: Proceedings of ICCET 2021, pages 83–92","venue":null,"work_id":"8b4c03ac-bed9-4fef-a7b7-d9211b36e7fe","year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.846676Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:bd70a597a8b0d1bfb8004e63f7147acc925ef285defcda40095b44000069389a","observation_id":"8f0d4748-a828-46ff-a306-34bb81aa4fdb","resolution":{"observed_at":"2026-08-11T20:38:02.711651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.679645Z","title":"In 2017 seventh international conference on Affective Computing and Intelligent Interaction Workshops and Demos (ACIIW), pages 79–80 (2017)","venue":null,"work_id":"da905929-273f-417e-8a06-deedb3cf9210","year":2017},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.852707Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:ddc4935d10150aa21747f1531894dee2308ca2cdde6b72b539bbe056cf714019","observation_id":"4258f317-d558-40b5-8bf0-51206ae62049","resolution":{"observed_at":"2026-08-11T20:38:02.685887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.652083Z","title":"In Proceedings of the AAAI conference on artificial intelligence, volume 30 (2016)","venue":null,"work_id":"432ab1fc-0dfd-43b4-af40-80b548c2e5d6","year":2016},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.859494Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:071e08b32d87f6648eb3b453724745eef047a47bfa3c9c686b7167e353bce980","observation_id":"c81c9578-815a-42b1-a169-c0e68cb2537d","resolution":{"observed_at":"2026-08-11T20:38:02.657784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.631618Z","title":"Multimodal emotion recognitionusingdeeplearning","venue":null,"work_id":"ec3c79ef-8895-4a9a-9614-5111e7a80f42","year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.866378Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:c049db487ac918977fd113a1acc9a5363bcf06cd916279ff4035e79f20062a5e","observation_id":"d22bed2b-83f6-4328-9592-841e4a64bdae","resolution":{"observed_at":"2026-08-11T20:38:02.636722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.611007Z","title":"In ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 6269– 6273 (2021)","venue":null,"work_id":"af200085-be93-4f9c-bbbe-4d9323360bf7","year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.872690Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:a0be677fd4316ca4aa36514cea57c6260cf7c3ef9c220a3ffc85e95343d4f6c4","observation_id":"11d941ef-eedb-499e-b5e7-c41d451b3a85","resolution":{"observed_at":"2026-08-11T20:38:02.619088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.577761Z","title":"In AVSP 2001-International Conference on Auditory-Visual Speech Processing (2001)","venue":null,"work_id":"ede9a361-2e2d-4597-8e96-1b4a6c9c734a","year":2001},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.880060Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:afaa9b3ece87f30ef089df1b46f3fda74f03c324d9b1b7ac488b9fe0f4fefc25","observation_id":"e592e0b5-83b1-4628-a472-b0c67f6711fb","resolution":{"observed_at":"2026-08-11T20:38:02.583663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.553082Z","title":"In Proceedings of the conference","venue":null,"work_id":"ee33e8e8-d34f-492a-a94a-5f9d040cc3f3","year":2019},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.888215Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:ad52074e10834795a9f0ea43afbf17720f21bf84325f6bbccc984dc6a25f7583","observation_id":"93ff3b66-8bd4-479b-a77d-f3712b9c5ae7","resolution":{"observed_at":"2026-08-11T20:38:02.567658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.519137Z","title":"IEEE Transactions on Multimedia (2022)","venue":null,"work_id":"c15757b7-d33c-49d2-bc36-7967543db772","year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.894927Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:3a7c80a0880ffa2d362b083f637f7a2a8a998b7e0802dad0d2e7abf44b75991b","observation_id":"9b0bb16a-6534-4836-848a-bc5d017117c6","resolution":{"observed_at":"2026-08-11T20:38:02.528916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.485820Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing, 29:3592–3603 (2021)","venue":null,"work_id":"d1ff2dce-fa62-4d04-8071-d97a16518c26","year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.900223Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:ffacb0b7963dd5179a3354ecb012ea79df2bae630092463e6634acc31e11fdef","observation_id":"139cbc43-57bf-432a-bfbd-a019b089ad22","resolution":{"observed_at":"2026-08-11T20:38:02.495930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.456575Z","title":"In Proceedings of the 28th ACM international conference on multimedia, pages 1122–1131 (2020)","venue":null,"work_id":"54f9ecad-1de9-4993-a450-b5573645623b","year":2020},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.907033Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:a9ff8f8d0df89ae1b2b8ec4a092438104a92925ffe919c69283e8862daeb65d0","observation_id":"027aeed2-1e83-4d08-9ca8-778caace0dc1","resolution":{"observed_at":"2026-08-11T20:38:02.467416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07637","last_updated":"2020-10-15T10:10:41Z","snapshot_observed_at":"2026-08-13T00:00:30.906973Z","submitted_at":"2020-10-15T10:10:41Z","title":"DialogueTRM: Exploring the Intra- and Inter-Modal Emotional Behaviors in the Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07637","snapshot_observed_at":"2026-08-11T20:38:01.914107Z","title":"arXiv preprint arXiv:2010.07637 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.914107Z"},"links":{"cited_paper":"/paper/2010.07637","citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:6fc7619196cab85d23318bd3d15432cdb9244107c1010d6bcb7a47fb2a120449","observation_id":"9c108565-c1c1-4f0c-9044-b4c0cd9116f3","resolution":{"observed_at":"2026-08-11T20:38:01.914107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06779","last_updated":"2021-07-14T15:37:02Z","snapshot_observed_at":"2026-08-14T19:30:03.656126Z","submitted_at":"2021-07-14T15:37:02Z","title":"MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06779","snapshot_observed_at":"2026-08-11T20:38:01.920850Z","title":"arXiv preprint arXiv:2107.06779 (2021) 12 F","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.920850Z"},"links":{"cited_paper":"/paper/2107.06779","citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:b915b4e72cec894a4562a1df5da2c1d3bdee2932bba6f63558360ffc268fa572","observation_id":"2d01b38e-ec0a-413d-ab04-70287b931bbf","resolution":{"observed_at":"2026-08-11T20:38:01.920850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.427301Z","title":"In ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 7037– 7041 (2022)","venue":null,"work_id":"118f28fc-5e6f-49ab-a434-c0553bdb4691","year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.929176Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:511518b3ee972fccf305fc5036ba368c2c36c1a524306a703563e0227e271627","observation_id":"1231d2dc-80e6-4105-a184-1b9cce8eaa8e","resolution":{"observed_at":"2026-08-11T20:38:02.432840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.407735Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 4652–4661 (2022)","venue":null,"work_id":"1221dbf4-08a2-495b-8a82-a3a77b6da37b","year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.935087Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:be467078a21ef1fe2c71979b3f0be03d29458b370779877591eb44155b10a133","observation_id":"f5f342c8-ee45-411c-b7e5-b6e75c0a8ebc","resolution":{"observed_at":"2026-08-11T20:38:02.413287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.370930Z","title":"Advances in neural information processing systems, 33:12449–12460 (2020)","venue":null,"work_id":"d1a7f776-dd1f-4c11-a4a7-2052f977c7e4","year":2020},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.941879Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:12b9fcdeea8c1f4ae1675753db586d33900b0467601075ed47247e1a6265378a","observation_id":"fc0c21ce-1eb2-46e7-9463-fa96279327bc","resolution":{"observed_at":"2026-08-11T20:38:02.380907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.331176Z","title":"Centralized feature pyramid for object detection","venue":null,"work_id":"414a0894-0699-4c37-90ab-d9046a14ad97","year":2023},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.946381Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:7b1cf9b9c670f8236e50b5805fffb38da35c6de53e79e6f92f3c9cdb00a04755","observation_id":"5fd2a026-115f-43ff-b3f0-3017e4ab8058","resolution":{"observed_at":"2026-08-11T20:38:02.338648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.305054Z","title":"Language resources and evaluation, 42:335–359 (2008)","venue":null,"work_id":"4e989780-4e39-46f4-b9af-b6c6a631be2f","year":2008},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.951740Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:b7cd50d026298ac092b3cd42bd1c6d11c237308a8e931493f336d295e3afe8c2","observation_id":"21ac3475-0b06-40ac-b452-8d20b1e91306","resolution":{"observed_at":"2026-08-11T20:38:02.319049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-14T18:19:10.821318Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-11T20:38:01.958786Z","title":"arXiv preprint arXiv:1810.02508 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.958786Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:0cbc2cd19a1d418cbd9273650a2c920e74baa75c5e4c2d8037c1028e0109db35","observation_id":"807482db-a36f-4fea-bd0d-bbce639f42f7","resolution":{"observed_at":"2026-08-11T20:38:01.958786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.281221Z","title":"In Proceedings of the 28th International Conference on Computational Linguistics, pages 4190–4200 (2020)","venue":null,"work_id":"dd8acbc6-a44f-46f8-a02c-48341f61e127","year":2020},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.965587Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:2c56eb31653012a91b996cdf742a680301a29a628bdf4fcc0b866e763220997f","observation_id":"5ec6c1a4-8b09-4d32-ab03-0300abee401d","resolution":{"observed_at":"2026-08-11T20:38:02.289001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.254384Z","title":"In Proceedings of the AAAI Conference on Artificial Intelligence, volume 35, pages 13789–13797 (2021)","venue":null,"work_id":"d594b5a7-962a-4b72-a767-48fb01075793","year":2021},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.972177Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:8cd2669b7727edfc74f3b0b9ed22132899aece3d5364a39ffeee5c697502e863","observation_id":"8754cb24-90ab-4a5e-9963-46622dff684b","resolution":{"observed_at":"2026-08-11T20:38:02.261810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02455","last_updated":"2022-05-05T05:54:24Z","snapshot_observed_at":"2026-08-13T15:49:48.655160Z","submitted_at":"2022-05-05T05:54:24Z","title":"COGMEN: COntextualized GNN based Multimodal Emotion recognitioN","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02455","snapshot_observed_at":"2026-08-11T20:38:01.978552Z","title":"arXiv preprint arXiv:2205.02455 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.978552Z"},"links":{"cited_paper":"/paper/2205.02455","citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:bb2b4031480d144beef6cb2a4c74f8e322894050859856d2cf0e083df0910f39","observation_id":"ce9f55e5-8624-468e-88f7-161c0aa4d89a","resolution":{"observed_at":"2026-08-11T20:38:01.978552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:38:02.204412Z","title":"Neural Computing and Applica- tions, pages 1–14 (2023)","venue":null,"work_id":"4355e6c3-759b-4f2a-b58e-e89f9417b1cc","year":2023},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.984168Z"},"links":{"citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:5b95de2b5aaa69ad02dbcc1bd84435c3563afaa6f19a6656ded23b6b3a62f387","observation_id":"b9b28c35-92b2-43d9-b28a-dd8b96bc7a1a","resolution":{"observed_at":"2026-08-11T20:38:02.228561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11256","last_updated":"2022-11-21T08:46:01Z","snapshot_observed_at":"2026-08-14T19:31:06.607382Z","submitted_at":"2022-11-21T08:46:01Z","title":"UniMSE: Towards Unified Multimodal Sentiment Analysis and Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11256","snapshot_observed_at":"2026-08-11T20:38:01.992997Z","title":"arXiv preprint arXiv:2211.11256 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:38:01.992997Z"},"links":{"cited_paper":"/paper/2211.11256","citing_paper":"/paper/2412.05558"},"observation_digest":"sha256:7fee996f47ee986f94b95ba14949dd67bcc3c9dbd7965ab324044235662bd348","observation_id":"65dcd5cc-aecb-498f-8bf5-4a31b6e0ac83","resolution":{"observed_at":"2026-08-11T20:38:01.992997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.05558","last_updated":"2024-12-07T06:43:39Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T21:24:20.794752Z","submitted_at":"2024-12-07T06:43:39Z","title":"WavFusion: Towards wav2vec 2.0 Multimodal Speech Emotion Recognition"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2412.05558."}