{"as_of":"2026-08-09T21:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:850f6e9bd0dd14554072069067a62c6a70d1c08e7bc7d03bedd8321f72c5ac6a","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:44:21.971254Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02080/citation-record","integrity":"/paper/2507.02080/integrity","json":"/paper/2507.02080/citation-record.json","paper":"/paper/2507.02080"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:18.155528Z","title":"Maven: Multi-modal attention for valence-arousal emotion network","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.155528Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:b452295f0686d867f924a145a346c3b93c1f4c9ec5e764207e2f70b3808bf5d8","observation_id":"adb0f36b-664d-4e1b-aa97-d19928e0cf55","resolution":{"observed_at":"2026-08-06T20:44:18.155528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.644660Z","title":"Gated multimodal networks","venue":null,"work_id":"5baea0ad-7412-40d5-93e5-2b5b295db13b","year":2020},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.206339Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:b84533fcb693f8f130c9be58eed476232aaaf3def0b9ec8d180a6e60a3f9c630","observation_id":"8a15a724-ae5f-498f-8496-2820847ba743","resolution":{"observed_at":"2026-08-06T20:44:22.647964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.632909Z","title":"Valence focus and arousal focus: Individual differences in the structure of affective experience","venue":null,"work_id":"f9755b27-06c7-4058-b17f-6133785e0cc1","year":1995},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.293003Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:ea8d0d0932b308ad044423c253e748e177e1467f922e5b935e479696c950e14a","observation_id":"54282bae-b66e-45ec-8a40-004fa50bad6f","resolution":{"observed_at":"2026-08-06T20:44:22.636828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.622249Z","title":"Joint modelling of audio-visual cues using attention mechanisms for emotion recognition","venue":null,"work_id":"c26773fd-d332-40bf-80a5-c57a33538122","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.364205Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:9364c7958a18309ae5fcc02619cbbf8442e78bfc18533d6648cac283422deb22","observation_id":"9af34998-835e-45d6-a2a3-23e6dc66d339","resolution":{"observed_at":"2026-08-06T20:44:22.625857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.610701Z","title":"Ms-celeb-1m: A dataset and benchmark for large-scale face recognition","venue":null,"work_id":"5842007b-81ec-402b-a3e4-4bd4347f0a41","year":2016},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.462272Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:239568ef8b0aa3b193564e23e8b15e19d7e8585f4e057b2d9fb70713bdc26041","observation_id":"2154ffd1-55c6-42a1-ad43-85a25ca49232","resolution":{"observed_at":"2026-08-06T20:44:22.614427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:18.519772Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.519772Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:889c211f5ac75e521c95bce8161b89ca16ba56864d3b4534184f8d1c0eda44cf","observation_id":"3ed6848f-edaf-46f0-93af-775fd11c7079","resolution":{"observed_at":"2026-08-06T20:44:18.519772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.591687Z","title":"Deep learning-based approach for con- tinuous affect prediction from facial expression images in valence-arousal space","venue":null,"work_id":"e40f43f0-14fd-49d4-a0bc-6fa3b56413b0","year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.617096Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:edc4e12c046c77b150a0e0b9cb55e3d81a4836d1dae97041320bfe18600bc698","observation_id":"dc2487bc-d498-4755-969f-efdc8c82796a","resolution":{"observed_at":"2026-08-06T20:44:22.596362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13285","last_updated":"2022-03-29T16:02:46Z","snapshot_observed_at":"2026-08-09T21:05:39.526564Z","submitted_at":"2022-03-24T18:22:56Z","title":"Continuous-Time Audiovisual Fusion with Recurrence vs. Attention for In-The-Wild Affect Recognition","version":2},"cited_work":{"arxiv_id":"2203.13285","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.13285","snapshot_observed_at":"2026-08-06T20:44:22.104836Z","title":"Continuous-Time Audiovisual Fusion with Recurrence vs. Attention for In-The-Wild Affect Recognition","venue":"cs.SD","work_id":"7c36352a-311d-489c-9cb4-edfa4cae4792","year":2022},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.687924Z"},"links":{"cited_paper":"/paper/2203.13285","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:19af721dea1f2f7f0828b3de76602c972cd2171151944df461fa944f7a5374d2","observation_id":"772f1660-88d3-4d0a-8662-1b7e01aa23d4","resolution":{"observed_at":"2026-08-06T20:44:22.111595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.580070Z","title":"Abaw: Valence-arousal estimation, ex- pression recognition, action unit detection & multi-task learning challenges","venue":null,"work_id":"3cc1cd4e-7132-431a-9cb1-6b9373ba99a1","year":2022},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.762242Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:27e696b6dcff2701eb121c64192139fb6e6cf3a453dbd1666952196d75d1aa03","observation_id":"321eb557-9b8f-42b1-a036-2a0eaae561a2","resolution":{"observed_at":"2026-08-06T20:44:22.584193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.568951Z","title":"Abaw: Learning from synthetic data & multi-task learning challenges","venue":null,"work_id":"7fe18c0e-5e50-436f-8260-e9d77e3c4874","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.822994Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:639095509d2dafdbb5fcfab6afc0bf9618c4734af1d90e11bc8f7c45296c96ae","observation_id":"31427eb2-ac68-4115-8700-a5969f13774d","resolution":{"observed_at":"2026-08-06T20:44:22.573098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.557505Z","title":"Multi-label compound expression recog- nition: C-expr database & network","venue":null,"work_id":"8274c6d8-69a7-436f-9020-8d698bbfdc93","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.911471Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:5fdb70a59eb6c14d142ac595e06077a4ea8c2cccc5576bf9a05f8cf5f7b9437c","observation_id":"ec734efa-6dcc-451d-8ff7-1344a518e0bc","resolution":{"observed_at":"2026-08-06T20:44:22.561232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04855","last_updated":"2019-09-25T22:45:18Z","snapshot_observed_at":"2026-07-06T08:28:35.109400Z","submitted_at":"2019-09-25T22:45:18Z","title":"Expression, Affect, Action Unit Recognition: Aff-Wild2, Multi-Task Learning and ArcFace","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04855","snapshot_observed_at":"2026-08-06T20:44:18.955974Z","title":"Expression, affect, action unit recognition: Aff-wild2, multi-task learning and arcface","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.955974Z"},"links":{"cited_paper":"/paper/1910.04855","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:a1900a75b32b923041b2a4d8df86e4c5798ef563bc58542a49564e260639b966","observation_id":"d35e1e0e-928b-473f-b131-0c09725a0a65","resolution":{"observed_at":"2026-08-06T20:44:18.955974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15792","last_updated":"2021-03-29T17:36:20Z","snapshot_observed_at":"2026-08-09T18:32:19.245927Z","submitted_at":"2021-03-29T17:36:20Z","title":"Affect Analysis in-the-wild: Valence-Arousal, Expressions, Action Units and a Unified Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15792","snapshot_observed_at":"2026-08-06T20:44:18.977500Z","title":"Affect analysis in-the-wild: Valence-arousal, expressions, action units and a unified framework","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:18.977500Z"},"links":{"cited_paper":"/paper/2103.15792","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:5fdc0714809581a7318cc0250503096786eb132a87dd57d40ae532e65a560ab1","observation_id":"1416043f-2f79-47a2-8c63-591df5a5ba4f","resolution":{"observed_at":"2026-08-06T20:44:18.977500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.545802Z","title":"Analysing affec- tive behavior in the second abaw2 competition","venue":null,"work_id":"c1cae452-6d27-4c18-9e3f-1f49cfaefa47","year":2021},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.023351Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:258f32ec2bd59c609db56066258520e6d06f0a0675f6ed36fbb536bb1567f71f","observation_id":"8038ab7f-ad45-464e-943a-f42dc222a415","resolution":{"observed_at":"2026-08-06T20:44:22.549475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.534362Z","title":"Analysing affective behavior in the first abaw 2020 competition","venue":null,"work_id":"ae255c9d-f649-4594-a1a5-9cd91ae00639","year":2020},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.062969Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:2cb31ad3a1940a1ed9dcd19a2d0f446919a3ec54a7a1a169e30ca74207b43845","observation_id":"48ae7f90-e52a-422a-9f39-48cba4b9eadb","resolution":{"observed_at":"2026-08-06T20:44:22.538337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11111","last_updated":"2020-05-29T02:35:49Z","snapshot_observed_at":"2026-07-06T08:31:56.527124Z","submitted_at":"2019-10-15T15:45:41Z","title":"Face Behavior a la carte: Expressions, Affect and Action Units in a Single Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11111","snapshot_observed_at":"2026-08-06T20:44:19.102470Z","title":"Face behavior a la carte: Expressions, af- fect and action units in a single network","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.102470Z"},"links":{"cited_paper":"/paper/1910.11111","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:8b24717a8c6b1bc0a6d94c0feb2a1f96098b128ae2e0c56da99697cea1a00c8e","observation_id":"fe4289f4-d6ab-4cf8-8f89-19999bc3477b","resolution":{"observed_at":"2026-08-06T20:44:19.102470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.523143Z","title":"Deep affect prediction in-the-wild: Aff-wild database and challenge, deep architec- tures, and beyond","venue":null,"work_id":"7de3fa3d-b689-40bf-8764-4bb917311cb0","year":2019},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.163243Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:1c6c64ec6292bb086b64a9abc59d1684c9a35f140df85d19d90df203920cf6a9","observation_id":"527f2aa2-f99a-4b3e-832a-562f14d863e6","resolution":{"observed_at":"2026-08-06T20:44:22.526876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03790","last_updated":"2021-05-08T22:26:52Z","snapshot_observed_at":"2026-08-09T14:24:36.086192Z","submitted_at":"2021-05-08T22:26:52Z","title":"Distribution Matching for Heterogeneous Multi-Task Learning: a Large-scale Face Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03790","snapshot_observed_at":"2026-08-06T20:44:19.216546Z","title":"Distribution matching for heterogeneous multi- task learning: a large-scale face study","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.216546Z"},"links":{"cited_paper":"/paper/2105.03790","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:492d46eaa6c87a7dd8f808465ed2ebf6ca45e689c89027838be163845b902c91","observation_id":"99ea2612-1655-43aa-bc73-80baf97278f0","resolution":{"observed_at":"2026-08-06T20:44:19.216546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.511373Z","title":"Abaw: Valence-arousal esti- mation, expression recognition, action unit detection & emo- tional reaction intensity estimation challenges","venue":null,"work_id":"7551f908-b6ac-4990-a66c-1960c0f79a2f","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.271625Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:be3f20d5c3f525d952faf5513d3aa419f4b111047b8bc75046070bd0cf461920","observation_id":"f95d004e-0214-4d5c-87e0-161a092088ad","resolution":{"observed_at":"2026-08-06T20:44:22.515640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.498711Z","title":"Distribution matching for multi-task learning of classification tasks: a large-scale study on faces & beyond","venue":null,"work_id":"328a0f9a-9517-4b9a-8333-b6a8773477d4","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.350788Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:1cc94becde79570abc4f9d338989cdee7e45ef138fa7485311d6c3be0c0caddf","observation_id":"a7cdfd12-b52b-4172-b165-aee9ec26c987","resolution":{"observed_at":"2026-08-06T20:44:22.503125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.485721Z","title":"The 6th affective behav- ior analysis in-the-wild (abaw) competition","venue":null,"work_id":"73f2fb55-5118-49b1-89a2-efc27d10cdcf","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.395305Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:9b461ac16e52a2ed112cad449a8c29526225b409c0858c735f791d34b2a5ef0e","observation_id":"0f8bbc7b-c0c6-4915-a7ce-40ae2a629447","resolution":{"observed_at":"2026-08-06T20:44:22.490707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03835","last_updated":"2024-07-08T10:40:53Z","snapshot_observed_at":"2026-07-06T18:41:27.621784Z","submitted_at":"2024-07-04T11:04:29Z","title":"7th ABAW Competition: Multi-Task Learning and Compound Expression Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03835","snapshot_observed_at":"2026-08-06T20:44:19.440218Z","title":"7th abaw competition: Multi-task learning and compound expression recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.440218Z"},"links":{"cited_paper":"/paper/2407.03835","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:5f1575c70508b9493307911dcb6f46e61ff8595e5a51c04628a4a28816ceb7bd","observation_id":"86e746f1-c41e-4851-a5e5-191d72c70b9d","resolution":{"observed_at":"2026-08-06T20:44:19.440218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05372","last_updated":"2025-05-29T01:27:33Z","snapshot_observed_at":"2026-08-09T07:33:29.138496Z","submitted_at":"2025-05-29T01:27:33Z","title":"DVD: A Comprehensive Dataset for Advancing Violence Detection in Real-World Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05372","snapshot_observed_at":"2026-08-06T20:44:19.523313Z","title":"Dvd: A comprehensive dataset for advanc- ing violence detection in real-world scenarios.arXiv preprint arXiv:2506.05372, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.523313Z"},"links":{"cited_paper":"/paper/2506.05372","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:4588805ebb04b7373641f4a2e78b49517247e04bb602f85739c16de5e80c21f4","observation_id":"ddafcc4c-10e6-4836-ad3c-b488f9ed466a","resolution":{"observed_at":"2026-08-06T20:44:19.523313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.473271Z","title":"Advancements in affective and behavior analysis: The 8th abaw workshop and competition","venue":null,"work_id":"52fbd717-46e6-4ff4-9764-06c7eea77e30","year":2025},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.586794Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:3ed643c6827e93d14753eca3c040b46ff413a5ddb9fd7dfb572babae857d190c","observation_id":"56fb3ec0-5a4d-4c34-8a43-bd6fa7dd6edd","resolution":{"observed_at":"2026-08-06T20:44:22.477889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.461212Z","title":"Gated mechanism for at- tention based multi modal sentiment analysis","venue":null,"work_id":"283b8ec6-044f-4ecd-9c0e-4fcb4ce0e331","year":2020},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.634158Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:9f6d52d299c7506e2d585bd6dcc495e90c3753b7e04175d942c964d7f62357cd","observation_id":"bbc6667e-a2c7-46f9-930b-dfacd59c51ba","resolution":{"observed_at":"2026-08-06T20:44:22.465891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.450048Z","title":"Emotion, artificial intelligence, and ethics","venue":null,"work_id":"df80eabf-a5ac-412b-9cee-1a38a8300227","year":2015},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.679003Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:9efd276c717205c83f47ccacc482ff605f4b0919fa01cf58ced845baa2199b93","observation_id":"4e0b2da9-86be-48b4-89ec-1ba9907f2861","resolution":{"observed_at":"2026-08-06T20:44:22.453885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.439204Z","title":"Multi-modal fusion network with complementarity and importance for emotion recognition","venue":null,"work_id":"8f671ea2-cd0d-4310-b8c9-1221f200f964","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.709574Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:413670d3293b58dc88cc1366bf55b05a69b7f1fc19f199e5d3fbabe5f008a340","observation_id":"1b9b5dba-8e12-4558-bbe2-6551eb179206","resolution":{"observed_at":"2026-08-06T20:44:22.443345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.428668Z","title":"Valence and arousal estimation based on multimodal temporal-aware features for videos in the wild","venue":null,"work_id":"681847a1-322c-462d-9b12-70c0ebdcd222","year":2022},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.762417Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:08227490152cd7e975d2211dc700bee42aead22fdda9fab6e2905069647dfabd","observation_id":"ab4c25aa-e8a7-4371-8ae9-0be369e54e97","resolution":{"observed_at":"2026-08-06T20:44:22.432242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.417889Z","title":"United we stand: Emphasizing commonali- ties across cognitive-behavioral therapies","venue":null,"work_id":"d1e9c4b4-443b-4b4d-a77c-e267d69fddb7","year":2013},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.807937Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:066cbcbbcd35b98df15f75296c5a365e06f689cc826cbf1d6da1f1858f996693","observation_id":"4f2e5900-cbe4-4ddd-a9f9-6de6ba3ec325","resolution":{"observed_at":"2026-08-06T20:44:22.421560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.406887Z","title":"Cnn-lstm facial ex- pression recognition method fused with two-layer attention mechanism","venue":null,"work_id":"22f25bdc-8718-4b81-8aa6-5e5727e22c86","year":2022},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.847887Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:9608eb42007dcfd4fe53e4e6c88baac4332ec3b82997249dfa14a45f8c7c17a2","observation_id":"bd54f25a-9a22-4500-835e-012ab1827522","resolution":{"observed_at":"2026-08-06T20:44:22.410572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.395391Z","title":"Mul- timodal emotion recognition using cross modal audio-video fusion with attention and deep metric learning","venue":null,"work_id":"a2c8b4cd-812a-4cba-892f-ca99b3be2028","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.888780Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:735fe501d33de4cc1eb68b7746dbfe8105d0fa54cb6bb1186699b1247e38dceb","observation_id":"b4c98aec-1ef2-4dc1-9daa-5ffbaecdcde5","resolution":{"observed_at":"2026-08-06T20:44:22.399920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.383585Z","title":"Cross-attention is not always needed: Dynamic cross-attention for audio-visual di- mensional emotion recognition","venue":null,"work_id":"69aebea9-a668-45c2-9f95-d128402e8953","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.951786Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:7c3cd3d8f10969c3b404bd6ac82196826a4d5f1e7fec1502833e0308ec943c49","observation_id":"68c6a5e7-b357-4a85-a392-afe472e92a4b","resolution":{"observed_at":"2026-08-06T20:44:22.388079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.371595Z","title":"Incongruity-aware cross-modal attention for audio-visual fusion in dimensional emotion recognition","venue":null,"work_id":"5c09cc23-21b6-4c5e-b19c-f45aa30646ea","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:19.989886Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:5dd59e31695fda8c83689750bec4ea826111587d447771f24929b2e9c4e328cb","observation_id":"78aad30c-a53f-41fb-aeec-786c5f0a3edc","resolution":{"observed_at":"2026-08-06T20:44:22.376056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.357715Z","title":"Recursive joint cross- modal attention for multimodal fusion in dimensional emo- tion recognition","venue":null,"work_id":"ac905247-bb65-45e7-a354-708ccd8e4f70","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.042508Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:eacfb466b2eb56d2b2ec11f9300f4b52c44d51ea85aa66e39cfdef7d6c88da5e","observation_id":"fc456000-efae-4ac2-8183-25063e1d43ff","resolution":{"observed_at":"2026-08-06T20:44:22.362720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.343915Z","title":"A joint cross-attention model for audio-visual fusion in dimensional emotion recognition","venue":null,"work_id":"b219a11a-4af3-4617-931d-56641cc68c0e","year":2022},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.107155Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:feaf3c1d476c813037edff76cbbb8bcbe9c60ebfd43c9da671f6af30640dd695","observation_id":"0704a91d-7057-429e-9e9d-ee7916c0345a","resolution":{"observed_at":"2026-08-06T20:44:22.348192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.331122Z","title":"Audio–visual fusion for emotion recognition in the valence– arousal space using joint cross-attention","venue":null,"work_id":"888f4289-bfd9-42d6-ad97-f44df2391836","year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.144703Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:71e22b703dfc4333e3fc7a73f49d9e85e4dd5394ff42ceee200ab61a910f5e85","observation_id":"f294aa7b-f263-44b2-82fc-e77124ec60f3","resolution":{"observed_at":"2026-08-06T20:44:22.335756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.310407Z","title":"Re- cursive joint attention for audio-visual fusion in regression based emotion recognition","venue":null,"work_id":"1bcbf3cd-6228-4261-a5db-169b90dc4579","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.213618Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:31f03f3e308043ce319cc0af97e78f098103550afb326b0f02571ce464954b02","observation_id":"a41a016f-36df-4e7f-b838-70b05b07b0d0","resolution":{"observed_at":"2026-08-06T20:44:22.321672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.295742Z","title":"A circumplex model of affect","venue":null,"work_id":"745a6db5-f08e-40e4-9cb2-eff25327e0b1","year":1980},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.217149Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:680f5aa8a7d115d3ab2afcfc07d6ab8cf909dfec85db8000fcd9f4a7308d2997","observation_id":"543975f0-aafc-4157-b92c-6c86b83084c3","resolution":{"observed_at":"2026-08-06T20:44:22.300250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.282284Z","title":"Audiovisual three-level fusion for continuous esti- mation of russell’s emotion circumplex","venue":null,"work_id":"71ec7de2-bc27-487f-9143-0d21d93f1035","year":2013},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.255287Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:fee4b4c1a28f057542267bbb97c5aa440c9e18d72bcae7bf0447c2452a5edf10","observation_id":"c428f214-0690-45e6-8a23-a6e3cbea8a92","resolution":{"observed_at":"2026-08-06T20:44:22.286943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.269055Z","title":"A novel spatio-temporal convolu- tional neural framework for multimodal emotion recogni- tion","venue":null,"work_id":"238afc13-38da-4b7e-8db5-647d6a6dc4b3","year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.360945Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:0400db4b0492f977bc9ec95584a852eecf5b157be089ba7c460bc6bcd108e63a","observation_id":"ad5e7b5c-8cc5-4889-9ddc-d298476ccd5d","resolution":{"observed_at":"2026-08-06T20:44:22.273441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T20:44:20.510410Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.510410Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:2261c5f59d6a222827d7484694f21ea645aaa345296c7e53bcd7d8ac986ebcbc","observation_id":"91beed96-c190-4ac6-bd46-7688cd6f4ba9","resolution":{"observed_at":"2026-08-06T20:44:20.510410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.256730Z","title":"Using deep and convo- lutional neural networks for accurate emotion classification on deap data","venue":null,"work_id":"4eef0330-29fe-424f-8c74-5e9d53ab1a2d","year":2017},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.674265Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:9da42a9b309375318cbb9979147ccc707b212cca2e9747f3146cd431243aa285","observation_id":"cac217ec-d3c4-43c5-9e2b-692481e93f27","resolution":{"observed_at":"2026-08-06T20:44:22.260945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.243446Z","title":"A multimodal fusion emotion recognition method based on multitask learn- ing and attention mechanism","venue":null,"work_id":"b15bf87f-5706-49e9-ba9b-34decca9e67e","year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.836939Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:e7a677bfead684f2332059d5dca759118efb8b87257a4e29c683e9be18e63453","observation_id":"c07c6317-b39c-40a4-aa56-453a65d37877","resolution":{"observed_at":"2026-08-06T20:44:22.248034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.230462Z","title":"Speech emotion classi- fication using attention-based lstm","venue":null,"work_id":"1abf8895-0579-43e0-9988-8888fcc74ec3","year":2019},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:20.972089Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:a1f47ec335d1564b2bf7436a1dc0204412e238cb1ee0d40438aa8c10f45cbff8","observation_id":"f267650b-37ab-4af0-bc62-5b54419ca85e","resolution":{"observed_at":"2026-08-06T20:44:22.235505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.216624Z","title":"Aff-wild: Valence and arousal ‘in-the-wild’challenge","venue":null,"work_id":"a1259f62-9376-40c3-8cb7-f9aecc7c7b39","year":2017},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.131157Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:8e3f93c908eb76baf1702bec8a0a231ccd5871d7690218000c02c5c4d9972286","observation_id":"a68ac420-a847-4c99-85e2-fa76362146d5","resolution":{"observed_at":"2026-08-06T20:44:22.221544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.202632Z","title":"Contin- uous emotion recognition with audio-visual leader-follower attentive fusion","venue":null,"work_id":"b717f5fe-fdd4-459e-a41d-6229b0cafe76","year":null},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.248080Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:da0b075958c7aee0e9834a33cf5a66d7e1c5378342169aab61158b2fd88619d4","observation_id":"c4de6969-7af0-4d76-9c8d-bd0928d60140","resolution":{"observed_at":"2026-08-06T20:44:22.207270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.189365Z","title":"Deep learning-based multimodal emotion recognition from audio, visual, and text modalities: A systematic review of recent advancements and future prospects","venue":null,"work_id":"a6001d1a-d52b-4ac9-91ad-0ca5e200d91c","year":2024},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.431220Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:329f2a337d607dfd6bd4819131d0632ced2ff70293fe68427a9408ef70d4d21d","observation_id":"646e9ce0-f87b-431d-aaef-98771a0308ce","resolution":{"observed_at":"2026-08-06T20:44:22.193649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.175285Z","title":"A multimodal semantic fusion network with cross-modal alignment for multimodal senti- ment analysis","venue":null,"work_id":"d81ed351-a03c-4235-b10a-4e588c7a3001","year":2025},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.548405Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:ada7563fce797eebfa0e049258979e039f0eaebd099e4aed9c1776de4426dd89","observation_id":"f8e8e021-4d5d-45f9-b6b5-a3bba7ac3114","resolution":{"observed_at":"2026-08-06T20:44:22.180022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.161888Z","title":"Multi- modal facial affective analysis based on masked autoencoder","venue":null,"work_id":"aa0fae02-d7fb-4bba-b1b6-ffc83cefa68f","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.649389Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:9aa33698c924df5c8165f026a827ad913d5b1a859fbd3be6e8655f56fb1f3392","observation_id":"c9d76662-b285-4b16-a3b5-553657319efd","resolution":{"observed_at":"2026-08-06T20:44:22.166333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.148852Z","title":"M 3 f: Multi-modal continuous valence-arousal esti- mation in the wild","venue":null,"work_id":"47669b6d-f001-48c2-a71c-0f4288e363ea","year":2020},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.800076Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:9a93db17a45696607348718004d00962ac6935f3780f9c61fb2f034e294618e1","observation_id":"b89931c9-4efb-44d9-9979-170bebca94ed","resolution":{"observed_at":"2026-08-06T20:44:22.152792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.135690Z","title":"Abaw5 challenge: A facial affect recognition ap- proach utilizing transformer encoder and audiovisual fusion","venue":null,"work_id":"e6b49fdd-b195-465c-8b06-16ee483911a7","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.935182Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:b41843fcbd3d198a1b47747392d3585a936a52a3f12214cf8ba767cd840f46c0","observation_id":"c8d857d8-c9ab-4673-ac44-4a7a6b3a2ee5","resolution":{"observed_at":"2026-08-06T20:44:22.140098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:22.120822Z","title":"Leveraging tcn and transformer for effective visual- audio fusion in continuous emotion recognition","venue":null,"work_id":"b6ec8f4c-b961-4844-b0d4-9f3a284ddc7f","year":2023},"citing_paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:21.971254Z"},"links":{"citing_paper":"/paper/2507.02080"},"observation_digest":"sha256:5786f10149e7dc0cafcddb58982ccd096728aade134a2eb81ac5de627735075a","observation_id":"cb3d9f7c-d28e-4d25-858d-fa86bcbab7c2","resolution":{"observed_at":"2026-08-06T20:44:22.125976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02080","last_updated":"2025-07-02T18:31:24Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-09T18:13:58.043346Z","submitted_at":"2025-07-02T18:31:24Z","title":"TAGF: Time-aware Gated Fusion for Multimodal Valence-Arousal Estimation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2507.02080."}