{"as_of":"2026-08-09T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b62290e5e0fd1acfc200a3aea47665c22d1e11ec915fca9e50e27d285e782c52","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:08:58.980743Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.11892/citation-record","integrity":"/paper/2507.11892/integrity","json":"/paper/2507.11892/citation-record.json","paper":"/paper/2507.11892"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:09.937963Z","title":"The extended cohn-kanade dataset (ck+): A complete dataset for action unit and emotion-specified expression,","venue":null,"work_id":"90e56f50-e49a-483b-89d5-8c97f5b9d073","year":2010},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.233116Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:6aeb0d824773becc14ce5f240d39c2485c86cb03abb32bb7a79d4766588e52ce","observation_id":"2f80eff5-5e07-4e4f-bc11-824bde58144a","resolution":{"observed_at":"2026-08-06T17:09:10.037724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:09.662711Z","title":"Induced disgust, happiness and surprise: an addition to the mmi facial expression database,","venue":null,"work_id":"771caf24-484c-474a-b69a-32614b2df2cf","year":null},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.371685Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:d7d2b87875cf9b4bc51318737f37db7da1313fbfa162bfe74a72d10698d58dda","observation_id":"8f33e461-9f0b-45e0-87f3-fc36ada3e9af","resolution":{"observed_at":"2026-08-06T17:09:09.788431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:09.383483Z","title":"Facial expression recognition from near-infrared videos,","venue":null,"work_id":"651bd157-2948-4c82-bd26-a8fb07748956","year":2011},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.524779Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:cced59f4895882b44f043390c778500933d989ca4eb96b28bd07b33c63d08a95","observation_id":"c7d2cc0f-ba65-45e7-82ba-d384efa2e394","resolution":{"observed_at":"2026-08-06T17:09:09.507381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:09.040863Z","title":"Dfew: A large-scale database for recognizing dynamic facial expressions in the wild,","venue":null,"work_id":"2867517c-af36-47bf-a672-f5611547b60a","year":2020},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.678700Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:bce1ab6656a1600398317b8f2f7ed83dd8959fb713edd57777ce15b8234ae479","observation_id":"697b9dc7-4c81-4042-ba30-c4b59b5cdca8","resolution":{"observed_at":"2026-08-06T17:09:09.232452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:08.825091Z","title":"Mafw: A large-scale, multi-modal, compound affective database for dynamic facial expression recognition in the wild,","venue":null,"work_id":"5848c4ab-05d2-4f4c-a34f-ef4ce28588c8","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.819097Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:9b2b0704535fef28a4f3cad166a7a69eac9896e8b4cb45a668a6686c9de9b22f","observation_id":"7b370099-2a7c-449f-acc8-6c8f058cd5f8","resolution":{"observed_at":"2026-08-06T17:09:08.923395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:08.562524Z","title":"Ferv39k: A large-scale multi-scene dataset for facial expres- sion recognition in videos,","venue":null,"work_id":"91f82899-fbf2-4a7c-903b-f5185df692e7","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:49.985284Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:aa38a9fd02fc2af14edc32a38f0583497d0c27122c4d705e4c952d622b1cc411","observation_id":"bbf98089-a486-4f67-9f52-4f89fe49eff0","resolution":{"observed_at":"2026-08-06T17:09:08.691148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:08.434815Z","title":"Dep-fer: Facial expression recognition in depressed patients based on voluntary facial expression mimicry,","venue":null,"work_id":"125d055b-babc-465d-aeb5-8622b306681e","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:50.172639Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:800302917b6abf4268c0d2ac4c0009a7b72d6cd0d6d1c4398ec864dbebb3f195","observation_id":"154984c9-e876-47c2-84ae-4d67398609e4","resolution":{"observed_at":"2026-08-06T17:09:08.492490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:08.297262Z","title":"Efficient facial expression recognition with representation reinforcement network and transfer self-training for human–machine interaction,","venue":null,"work_id":"3f60aa4a-dcec-4617-a8c0-58fdd0dad0e2","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:50.384854Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:f91bc2809f6b4eb1e1245254729e124db7b34edb5f7b3a3d4b993031c5fbe75e","observation_id":"770416af-30bd-44e0-ab48-7554f99f46f0","resolution":{"observed_at":"2026-08-06T17:09:08.367493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:08.159458Z","title":"Predicting personal- ized image emotion perceptions in social networks,","venue":null,"work_id":"dacda61a-4608-4589-b33c-a98462d93c74","year":2016},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:50.553598Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:a1941f58bb245ecea45a2222dd11a3f2aaacc47796212d53a6fba4e7172d6c23","observation_id":"afccfec2-b81d-41ca-baa9-d4b7a9b331e4","resolution":{"observed_at":"2026-08-06T17:09:08.225797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:07.985420Z","title":"Spatio-temporal convolutional features with nested lstm for facial expression recognition,","venue":null,"work_id":"30ae8790-f795-43b9-aaeb-f7bdd28799e0","year":2018},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:50.726269Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:6ff8ac5b7165f19e2d24597fe29a8a0a9c6122b51bc80a53f01204dfe0df291f","observation_id":"8e3d8a74-1cb2-45fd-9683-5afaff8dc945","resolution":{"observed_at":"2026-08-06T17:09:08.056382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:50.885960Z","title":"Saanet: Siamese action-units attention network for improving dynamic facial expression recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:50.885960Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:2c67d63967d7fd903d4f11e335d42965cfdb20183c6552736f9d7ca111fc55a8","observation_id":"5639bf19-85ab-4294-8870-a9829cdffe31","resolution":{"observed_at":"2026-08-06T17:08:50.885960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:51.446133Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:51.446133Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:90824e22908a45e267e480317676c06e6314a009ee0741d859b1856faff9a134","observation_id":"9fe8fd94-4f81-4457-8460-8a451088566b","resolution":{"observed_at":"2026-08-06T17:08:51.446133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:07.792643Z","title":"Former-dfer: Dynamic facial expression recog- nition transformer,","venue":null,"work_id":"77d84b96-ca8b-4cf1-95c1-0fd9efbf4d50","year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:51.579156Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:d8f8bb1233719c661f9830e46bc444ee3f74d00725d716ac3c072cc97ef32068","observation_id":"76ef193a-40c2-48a4-8ada-3bf341c47643","resolution":{"observed_at":"2026-08-06T17:09:07.867624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:51.756681Z","title":"Ex- pression snippet transformer for robust video-based facial expression recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:51.756681Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:392c86ce1db3e35dcc6927b072ecd6bcf5860d400bb43f0768087257a008e6cf","observation_id":"80ec1c43-07f3-4a26-b909-4f2dc26d0eb7","resolution":{"observed_at":"2026-08-06T17:08:51.756681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:52.037086Z","title":"Freq-hd: An interpretable frequency-based high-dynamics affective clip selection method for in-the-wild facial expression recognition in videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.037086Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:6a6ec9f1d857846650029846adc5605a87ee683a0b4734970889a9f38e064bed","observation_id":"0b439d16-a4e4-443e-8a0d-f2d8140ab652","resolution":{"observed_at":"2026-08-06T17:08:52.037086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:07.610794Z","title":"Facial expression recognition with adaptive frame rate based on multiple testing correction,","venue":null,"work_id":"fd124ee4-8ea4-4308-81a2-1f6586318764","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.159837Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:a33e37be67f5dfaa0868256a00b209752bb7bfecbbfaeea5b1bd6681c59fa5fe","observation_id":"18c7a973-d1b5-4155-985c-bc9ab4855e05","resolution":{"observed_at":"2026-08-06T17:09:07.651357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:07.334722Z","title":"Video-based facial micro-expression analysis: A survey of datasets, features and algorithms,","venue":null,"work_id":"e22c6041-7de7-4f0c-aa83-bc649df51e11","year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.268113Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:ba17d198f06ff437f90de06de0314bde5a71edd32e12b65e652a8da507fe660d","observation_id":"a028bf9e-5a31-4acf-b5d9-cbfd4792e5d4","resolution":{"observed_at":"2026-08-06T17:09:07.455501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:07.021471Z","title":"Dynamic facial expression recognition under partial occlusion with optical flow reconstruction,","venue":null,"work_id":"f42a7442-283b-4a3e-b1ed-42f3484c7e6f","year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.428689Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:012bc75dd1337a5ad2b71dd24daffa40afa5d97576e02c0e49c937ec35796a4d","observation_id":"7fd07951-24e8-4737-90d0-a71bd023e60d","resolution":{"observed_at":"2026-08-06T17:09:07.145228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:06.417541Z","title":"From static to dynamic: Adapting landmark-aware image models for facial expression recognition in videos,","venue":null,"work_id":"2dc7cc8d-4d55-4e2b-a426-cfc0fa9af334","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.667666Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:a0458ff1b36e5eb41a118891450aad29483577ad09070fa612bbfa87e8a80cee","observation_id":"c2d87dcf-a356-49e0-8c39-70c1a6bfed9d","resolution":{"observed_at":"2026-08-06T17:09:06.532422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15777","last_updated":"2024-08-28T13:15:25Z","snapshot_observed_at":"2026-08-09T10:41:14.728847Z","submitted_at":"2024-08-28T13:15:25Z","title":"A Survey on Facial Expression Recognition of Static and Dynamic Emotions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15777","snapshot_observed_at":"2026-08-06T17:08:52.781534Z","title":"A survey on facial expression recognition of static and dynamic emotions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.781534Z"},"links":{"cited_paper":"/paper/2408.15777","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:637c2c6e44c1da49a414691bf5cc2be4d517706147b739e4c7d7b8a48452cc58","observation_id":"e9feacc7-04c8-4699-b675-a01cc7560e19","resolution":{"observed_at":"2026-08-06T17:08:52.781534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13382","last_updated":"2024-11-26T16:37:36Z","snapshot_observed_at":"2026-08-09T12:56:13.219816Z","submitted_at":"2023-08-25T13:52:05Z","title":"Prompting Visual-Language Models for Dynamic Facial Expression Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13382","snapshot_observed_at":"2026-08-06T17:08:52.937811Z","title":"Prompting visual-language models for dynamic facial expression recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:52.937811Z"},"links":{"cited_paper":"/paper/2308.13382","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:c521b2db6c8204780b7042a605d8518ef28e7424ec0bacdc1f0ef83206fb227b","observation_id":"0e0c819f-6ba6-426b-852d-26ab597a8c06","resolution":{"observed_at":"2026-08-06T17:08:52.937811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:06.103865Z","title":"Emoclip: A vision-language method for zero-shot video facial expression recognition,","venue":null,"work_id":"fab9f89e-4cdf-4580-b043-4cf0a58b3f82","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.030094Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:00aa1cdeadf0bf3ef5ee55c0a3fc3eb92f0758e6aed062d41714ca14a9d129b3","observation_id":"4e4d0b94-72eb-4c57-bbbd-9f175b5202df","resolution":{"observed_at":"2026-08-06T17:09:06.252373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4647.36817","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:59.769486Z","title":"Domain knowledge enhanced vision-language pretrained model for dynamic facial expression recognition,","venue":null,"work_id":"d532be21-e17d-456e-9bd6-affaa7615a6d","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.192045Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:d791183e51ac4804b494ecf45f21906f2515568b2e61dfd930a2f4977f007d40","observation_id":"964eea29-3d44-4c2b-b79f-40a7c4518bee","resolution":{"observed_at":"2026-08-06T17:08:59.856215Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:05.813615Z","title":"Enhancing zero-shot facial expression recognition by llm knowledge transfer,","venue":null,"work_id":"6f7d8c5d-d685-489f-a2e0-46b5c2d7f389","year":2025},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.286611Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:8dc5ff8cfd426e1e46e20ef901db607a45e0621174be351ca4522d40c46f83cb","observation_id":"cfdaf705-c9c9-4083-b02b-5a5371ec2dfe","resolution":{"observed_at":"2026-08-06T17:09:05.963193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:53.456059Z","title":"Finecliper: Multi-modal fine-grained clip for dynamic facial expression recognition with adapters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.456059Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:74b60a3209d741ace558445f91a5e4df84a8b81ab41edc8f280f8e92dbe79451","observation_id":"65ef274e-e86c-4c71-a2ac-6d5b54a12094","resolution":{"observed_at":"2026-08-06T17:08:53.456059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:05.462331Z","title":"Describe your facial expressions by linking image encoders and large language models","venue":null,"work_id":"b95b19d1-8eac-4fb8-815a-05c333c590a7","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.642988Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:044009d02a76cb33ef97f4a5410a3f40d623666100942d3e5cfdff0ae714f2fc","observation_id":"1013a341-58d0-45a2-ba81-9eef0ddfdd18","resolution":{"observed_at":"2026-08-06T17:09:05.528965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:53.771017Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.771017Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:a772f5b78b6a0f438bb1c8e80875cdde1f5b6d156b8a9719a57219b5a9adb598","observation_id":"4efb4a3a-9c7f-49e8-8ad4-233405174190","resolution":{"observed_at":"2026-08-06T17:08:53.771017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13164","last_updated":"2019-05-30T16:49:11Z","snapshot_observed_at":"2026-08-07T07:47:18.837069Z","submitted_at":"2019-05-30T16:49:11Z","title":"Hierarchical Transformers for Multi-Document Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13164","snapshot_observed_at":"2026-08-06T17:08:53.883130Z","title":"Hierarchical transformers for multi-document summarization,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.883130Z"},"links":{"cited_paper":"/paper/1905.13164","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:320011dc039ab6e4f6b3d1a9887b831ef592055787e51c72b82ca3e2d1bf2af0","observation_id":"acbe33dc-ae8f-43e1-a5a4-b2d18cd43e08","resolution":{"observed_at":"2026-08-06T17:08:53.883130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08330","last_updated":"2024-07-11T09:28:04Z","snapshot_observed_at":"2026-08-03T19:52:23.327084Z","submitted_at":"2024-07-11T09:28:04Z","title":"HDT: Hierarchical Document Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08330","snapshot_observed_at":"2026-08-06T17:08:53.989568Z","title":"Hdt: Hierarchical document transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:53.989568Z"},"links":{"cited_paper":"/paper/2407.08330","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:ef44a5b36d840d462c6f8ec115dc775816d20ef7030aceb216a059e80c51414b","observation_id":"725a3fc7-35fd-49bc-ac14-a37a4d0e6b46","resolution":{"observed_at":"2026-08-06T17:08:53.989568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:05.269835Z","title":"Multi-task learning of hierarchical vision-language representation,","venue":null,"work_id":"db1cc455-6e45-472e-8eb6-09cd3c9fdde7","year":2019},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.100810Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:d5e85ed3de80233e4b7d7975498079eac6f091cc837b541f4c8dbea936da2926","observation_id":"ce50ff7e-9644-4481-b55c-2d587c8e3144","resolution":{"observed_at":"2026-08-06T17:09:05.349116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00200","last_updated":"2020-09-29T20:37:17Z","snapshot_observed_at":"2026-08-07T23:43:49.317779Z","submitted_at":"2020-05-01T03:49:26Z","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00200","snapshot_observed_at":"2026-08-06T17:08:54.214011Z","title":"Hero: Hier- archical encoder for video+ language omni-representation pre-training,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.214011Z"},"links":{"cited_paper":"/paper/2005.00200","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:fab968090e437e2f62e42d579fa4eab976d978cbc3feb0858e50f560c0e55bd1","observation_id":"0ca66b65-6b30-4633-b844-1cc8f35be18f","resolution":{"observed_at":"2026-08-06T17:08:54.214011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:05.055848Z","title":"Hierarchical modular network for video captioning,","venue":null,"work_id":"f911630e-0266-4938-b184-099002ad9e41","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.323924Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:0e5dbbd9a61ce140b8e91b7323ea403654b66d2f50cebb6fd6ad2d0d422b03ea","observation_id":"242d3e97-996a-4f4f-86b9-67bcf9fb00d2","resolution":{"observed_at":"2026-08-06T17:09:05.135439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:54.486076Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.486076Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:c395755edda0d356b8feef85360f230fa1a9d159bfa7eb16d2d9fb935737f9b1","observation_id":"cb83ea55-fd32-41b7-87bb-c41d4f594515","resolution":{"observed_at":"2026-08-06T17:08:54.486076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:05.599642Z","title":"Ceprompt: Cross-modal emotion-aware prompting for facial expression recognition,","venue":null,"work_id":"f8593630-c911-4b27-9f80-b66d4ea8acd2","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.620430Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:0d0e226e871ee5f66afccfd8b91c2d27a0aaa4509f31d5197ead5a583d77f659","observation_id":"190d69ec-35eb-46a9-8f1f-3895e2b534c9","resolution":{"observed_at":"2026-08-06T17:09:05.672039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:04.752313Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport,","venue":null,"work_id":"cd393155-f26d-4aba-baef-105a5e3056f4","year":2013},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.819539Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:75b07aba16258df71d5cbc77cb7304b7d165adaa381645e38648610c4156c844","observation_id":"06cef10d-69f3-47cb-a657-62d3cab51910","resolution":{"observed_at":"2026-08-06T17:09:04.917377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:04.476707Z","title":"Recent advances in optimal transport for machine learning,","venue":null,"work_id":"3db7c659-bcfd-42c9-88aa-23d9f449a36c","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:54.948095Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:427dd1da349f88d6bab635f05a51b0862986bf08a101ca4e6354ea8c151bc5b8","observation_id":"5110dfd2-d14c-4c5c-9502-d00fe488b898","resolution":{"observed_at":"2026-08-06T17:09:04.570793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:55.068589Z","title":"Reliable weighted optimal transport for unsupervised domain adaptation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.068589Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:b33fc86f737be655bb8ebd4f205b13b47c2a0bfc2095f46cf38e73a7d91cc707","observation_id":"7cb898f7-e789-4677-a77b-f6aee9e2dcfe","resolution":{"observed_at":"2026-08-06T17:08:55.068589Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:04.200755Z","title":"Unsupervised learning of visual features by contrasting cluster as- signments,","venue":null,"work_id":"e038d87d-9f6c-4f6f-8af6-032b6877d672","year":2020},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.184879Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:94e30a8bde27c608da38fa3367c794254eb746cd0c8818e9f4d0ac4c6869adad","observation_id":"ff886e30-8ed9-46c3-8ff7-4223c9bcf03d","resolution":{"observed_at":"2026-08-06T17:09:04.349557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:03.950270Z","title":"Optimal partial transport based sentence selection for long-form document matching,","venue":null,"work_id":"304e619c-c414-40c2-804c-5b7806476bc4","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.298606Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:2f13369040dfbd06944474210944400be74367f4fcad6d0628c2a61fa0c98846","observation_id":"8550292e-d670-4762-98d3-edd840d6d036","resolution":{"observed_at":"2026-08-06T17:09:04.049201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:03.739825Z","title":"Learning to align sequential actions in the wild,","venue":null,"work_id":"86cab831-61d7-47df-8f45-dca543e0912c","year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.446654Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:30d82f4068c4ac4f4915cfb0e083102a63694f9169efcc9efe776af22d493e6b","observation_id":"ee3bd80c-b722-45b9-8bfb-73909537e983","resolution":{"observed_at":"2026-08-06T17:09:03.796463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:03.470019Z","title":"What when and where? self-supervised spatio-temporal grounding in untrimmed multi-action videos from narrated instructions,","venue":null,"work_id":"76dbec48-84d0-426e-a38e-f5700d879438","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.583412Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:3960823f39bb7d57cf2c8b951b604e5c76a2e5513d2767ed3df3264173173b4b","observation_id":"55dcb424-4071-4d6f-abbd-814214ae3886","resolution":{"observed_at":"2026-08-06T17:09:03.611461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16702","last_updated":"2024-01-30T03:03:26Z","snapshot_observed_at":"2026-07-06T17:22:15.248410Z","submitted_at":"2024-01-30T03:03:26Z","title":"Multi-granularity Correspondence Learning from Long-term Noisy Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16702","snapshot_observed_at":"2026-08-06T17:08:55.704482Z","title":"Multi- granularity correspondence learning from long-term noisy videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.704482Z"},"links":{"cited_paper":"/paper/2401.16702","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:428792977844ee45db74743d274d91f3db6c2694afa8deaa6e0937cf79677eb5","observation_id":"a0a922a5-baee-4e19-869d-6cc760f1c08f","resolution":{"observed_at":"2026-08-06T17:08:55.704482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:06.701985Z","title":"Spatial- temporal graphs plus transformers for geometry-guided facial expression recognition,","venue":null,"work_id":"e6df5afd-ce6b-4bce-8644-4421f0ca9ffd","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:55.829988Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:c3a20fb9d934de2adedbe7116a9d6a0f7f12838f6e204e8f2af3c958d19fda8d","observation_id":"3acb2635-48d1-4bd5-8d6f-82a43a92f8d2","resolution":{"observed_at":"2026-08-06T17:09:06.842125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:02.876675Z","title":"Multimodal transformer for unaligned multimodal language sequences,","venue":null,"work_id":"fe7d5e0a-b4ab-4e83-8203-3646b1176c35","year":2019},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.109359Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:96e8841d535ed83e89d92b9636c2a982b2bba40a6040b6c0a4253e83bdc2a46d","observation_id":"22258bd3-e252-4538-b727-1377306c1864","resolution":{"observed_at":"2026-08-06T17:09:02.956146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:56.248682Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.248682Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:497ac08fa233b4028ec1184b506e828ac53a8a1ce47c66d74b5a131b32a13f1f","observation_id":"e3b68206-aaa7-440c-8809-87610c2582a6","resolution":{"observed_at":"2026-08-06T17:08:56.248682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:56.385574Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.385574Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:667eab101e9ca61c494f08f99f526adb26b24e1c982119acb86e3a3e6eed08af","observation_id":"adc6628f-859d-410f-b0bc-9ed5bdce20f6","resolution":{"observed_at":"2026-08-06T17:08:56.385574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:02.557720Z","title":"Cliper: A unified vision-language framework for in-the-wild facial expression recognition,","venue":null,"work_id":"c09ace6a-9731-45f3-b603-d5937206aefc","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.546603Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:b22baa29b6406a5cbc33338dee5d3f3de0ec973c8e9177c5cbf4448d5c20abf9","observation_id":"91adfa9d-5d95-413a-b0dc-543745217bdc","resolution":{"observed_at":"2026-08-06T17:09:02.695424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T17:08:56.717302Z","title":"Video-llava: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.717302Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:1e42d431c9fa59af5a9c4cc048462fbc8417000d920d13faef19ee02794d2542","observation_id":"a771a906-1941-46cd-9384-d776e716758d","resolution":{"observed_at":"2026-08-06T17:08:56.717302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:56.854748Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.854748Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:ed87a4979b5e71b5a506c53674e5420731bde6594dabd9290a77993e48d38e2a","observation_id":"2ef3652f-b4ba-4a6a-9be8-6020b5bdcb3b","resolution":{"observed_at":"2026-08-06T17:08:56.854748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-06T17:08:56.989600Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:56.989600Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:b50b8764594283302cfa2fe355b9962fbb6757b246f2c14343ff9569cdb9868c","observation_id":"0ff0bbb6-eb8a-41d8-ba58-e1eb879b040d","resolution":{"observed_at":"2026-08-06T17:08:56.989600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:57.095778Z","title":"Videomae: Masked autoen- coders are data-efficient learners for self-supervised video pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.095778Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:6ad87f9c785c9790f066ca0b23cb398084166ca25cbec17390a7cf90da28212d","observation_id":"d7fdddc8-f420-4089-a31d-40ca86630da1","resolution":{"observed_at":"2026-08-06T17:08:57.095778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:57.212905Z","title":"Mae-dfer: Efficient masked autoencoder for self-supervised dynamic facial expression recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.212905Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:b581920e8ea09105a008252941022c10c1d9e1025b5e54165880c01e2ebbeb93","observation_id":"c0f13447-3841-4612-bf12-eab2e9546562","resolution":{"observed_at":"2026-08-06T17:08:57.212905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:02.261483Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- 14 tioning,","venue":null,"work_id":"347a8581-146b-4837-b63e-8510aa46c5ac","year":2018},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.346343Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:7d57adc93d8a85f4474a53cd3111117f046cff43b22a1b61469e3e84cd6b9700","observation_id":"40c53bc4-6176-455b-b879-1db2e02025b8","resolution":{"observed_at":"2026-08-06T17:09:02.372262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:02.033614Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":"6fbaa970-740b-4111-9acc-511991610a72","year":2021},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.491789Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:59b9f18aab4019b8b050e99068171ba75634e0e40db62313ed34687424d0c9d5","observation_id":"0d0349cd-faf4-4122-9945-7563471fbdbb","resolution":{"observed_at":"2026-08-06T17:09:02.133934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:01.760917Z","title":"Emotion recognition using imperfect speech recognition,","venue":null,"work_id":"456c1527-2179-4fc1-9734-273fab89fc5a","year":2010},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.635608Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:2241a96841e6c103acf3a07c66547d7a918c618185cc3dd7242b9d11410b2f12","observation_id":"c3208862-0942-423d-9cbc-8b85e139500c","resolution":{"observed_at":"2026-08-06T17:09:01.900774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:01.465912Z","title":"Posterior calibration for multi- class paralinguistic classification,","venue":null,"work_id":"577867cd-a030-4186-ae21-661201e4c04f","year":2018},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.805680Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:13784c2c704e437f3e05c2e503437dd6cbf4b33e064b02123e6b012f3734bea7","observation_id":"0edd08c9-2483-4ae2-b727-2e19eecae091","resolution":{"observed_at":"2026-08-06T17:09:01.577572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:01.184757Z","title":"Rethinking the learning paradigm for dynamic facial expression recog- nition,","venue":null,"work_id":"d75cc614-0e90-4621-9653-942254b713fe","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:57.917571Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:2c5a2ca055ce8ac3839cbaab6193d00757c6a21c7cedc990bc792c1bf4e73870","observation_id":"b06a9716-7b97-40fa-a894-d07f957a2a4c","resolution":{"observed_at":"2026-08-06T17:09:01.317518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04294","last_updated":"2024-03-07T07:43:04Z","snapshot_observed_at":"2026-08-07T06:14:58.076860Z","submitted_at":"2024-03-07T07:43:04Z","title":"A$^{3}$lign-DFER: Pioneering Comprehensive Dynamic Affective Alignment for Dynamic Facial Expression Recognition with CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04294","snapshot_observed_at":"2026-08-06T17:08:58.053197Z","title":"A ˆ3 lign-dfer: Pioneering comprehensive dynamic affective alignment for dynamic facial expression recognition with clip,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.053197Z"},"links":{"cited_paper":"/paper/2403.04294","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:fc4e2bd5530cf0a111c95dfb29a8da3bb3070aee50487bc76c2cd8e28ba9e149","observation_id":"e9fc0632-63cf-4362-9066-95f90e68fbd1","resolution":{"observed_at":"2026-08-06T17:08:58.053197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:00.852550Z","title":"Clip-aware expressive feature learning for video-based facial expression recognition,","venue":null,"work_id":"ef09cd89-eae9-485c-89fc-209aebb1a89f","year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.167769Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:eafda55f11de2a5f8f18c34b2ffe21e10d48715b6c63a4c33b671a6e84166f57","observation_id":"bb674402-af34-407a-86c6-4a7b01908490","resolution":{"observed_at":"2026-08-06T17:09:01.028233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04975","last_updated":"2022-06-10T10:17:30Z","snapshot_observed_at":"2026-07-06T13:19:26.611207Z","submitted_at":"2022-06-10T10:17:30Z","title":"NR-DFERNet: Noise-Robust Network for Dynamic Facial Expression Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04975","snapshot_observed_at":"2026-08-06T17:08:58.322047Z","title":"Nr-dfernet: Noise-robust network for dy- namic facial expression recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.322047Z"},"links":{"cited_paper":"/paper/2206.04975","citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:315633e539d369d3a4a5e9c9ab2d3c147d6086a1f020e322a11a0b53e35a358c","observation_id":"5c53bea4-72b1-4926-8ec7-ed45a3ceb9b8","resolution":{"observed_at":"2026-08-06T17:08:58.322047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:08:58.457153Z","title":"Logo-former: Local-global spatio-temporal transformer for dynamic facial expression recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.457153Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:56e594d6c59e673d4afaccb5423b2d85d85b73883012abff1a5aa05a45090b1d","observation_id":"c01291c4-fcdc-4459-8ccd-dd3fbabce61f","resolution":{"observed_at":"2026-08-06T17:08:58.457153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:03.115305Z","title":"Intensity-aware loss for dynamic facial expression recognition in the wild,","venue":null,"work_id":"d182b8ad-845c-4a8b-a38d-b1ff489fb5b5","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.592846Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:fbe5ad4ae6b97a909c2b7cca56f4711b6a3f40ced47dbcfb31fa44f85db5fb85","observation_id":"025acfcc-723b-4024-9ea7-4130c4153e70","resolution":{"observed_at":"2026-08-06T17:09:03.269880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:00.605082Z","title":"Transformer-based multimodal emotional perception for dynamic facial expression recogni- tion in the wild,","venue":null,"work_id":"4bc21782-3185-484c-b440-261e771ed768","year":2023},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.705759Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:af4d235e954ebfe4a88d115776acf6cd64ac58f51e4b651b7479a445cda4a684","observation_id":"44e6292c-dc8c-490b-8ef8-c2126613213e","resolution":{"observed_at":"2026-08-06T17:09:00.714047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:00.369172Z","title":"Svfap: Self-supervised video facial affect perceiver,","venue":null,"work_id":"46ce44b7-5cbb-4441-bf7b-62482b44af86","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.844014Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:e4ac8813443def3993718702b944c15712a5fbda874076b6d326d6f16bcea1ce","observation_id":"6d6c81c3-f280-4671-9ef9-d9f219746c94","resolution":{"observed_at":"2026-08-06T17:09:00.483481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:00.175909Z","title":"Hicmae: Hierarchical contrastive masked autoencoder for self-supervised audio-visual emotion recogni- tion,","venue":null,"work_id":"595471e3-493d-4a9b-a65f-cd3c1655e2bb","year":2024},"citing_paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:08:58.980743Z"},"links":{"citing_paper":"/paper/2507.11892"},"observation_digest":"sha256:e2d9941048b827076023828ef684803e54b1feb09e5854b28db52e93f61c999a","observation_id":"56f4fb15-b13d-4326-8e4b-6bd0070b72bd","resolution":{"observed_at":"2026-08-06T17:09:00.250849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.11892","last_updated":"2025-07-16T04:15:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:08:04.289398Z","submitted_at":"2025-07-16T04:15:06Z","title":"From Coarse to Nuanced: Cross-Modal Alignment of Fine-Grained Linguistic Cues and Visual Salient Regions for Dynamic Emotion Recognition"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2507.11892."}