{"as_of":"2026-08-11T21:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1468fe3f38fa4ce89f8e12a1f86ae3508d01ac8a1a2db05f5a732f75915fdb8a","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T20:58:37.097846Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23493/citation-record","integrity":"/paper/2607.23493/integrity","json":"/paper/2607.23493/citation-record.json","paper":"/paper/2607.23493"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:58:37.051498Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.051498Z"},"links":{"citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:7f83984c573851decb163d5290741af1915b62dd88d2a6472b793bf1d9ccb93c","observation_id":"6384f29a-f580-490b-987e-98c688113fcd","resolution":{"observed_at":"2026-07-30T20:58:37.051498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:58:37.059335Z","title":"Knowmeme: A knowledge-enriched graph neural network solution to offensive meme detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.059335Z"},"links":{"citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:a31f4047b3faf15ca9a0e65af583a5ee8b21874cb953c6720dae2783a52c14df","observation_id":"14d36f76-9da3-4d0e-a7f7-5414a5160d1a","resolution":{"observed_at":"2026-07-30T20:58:37.059335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:58:37.063002Z","title":"MOMENTA: A multimodal framework for detecting harmful memes and their targets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.063002Z"},"links":{"citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:8b780b8a5dce11eff648c031d11f4171b636c363dc057ec6fe86b70f0fd61ed2","observation_id":"b25e1de4-76dc-444c-b2d4-4926f7497ece","resolution":{"observed_at":"2026-07-30T20:58:37.063002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05738","last_updated":"2022-05-11T19:14:26Z","snapshot_observed_at":"2026-07-06T13:09:03.269759Z","submitted_at":"2022-05-11T19:14:26Z","title":"DISARM: Detecting the Victims Targeted by Harmful Memes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05738","snapshot_observed_at":"2026-07-30T20:58:37.066371Z","title":"Disarm: Detecting the victims targeted by harmful memes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.066371Z"},"links":{"cited_paper":"/paper/2205.05738","citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:9d87b416f8637d41532485de8cd64a69feb4eb6b8fab7e23265c4155d4692d51","observation_id":"08ccd657-b37e-4574-813a-9dfdda199423","resolution":{"observed_at":"2026-07-30T20:58:37.066371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:58:37.070428Z","title":"Prompting for multimodal hateful meme classification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.070428Z"},"links":{"citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:369dfc2070d8bd8db47a970e49bd1a685158d11a74216ff482d8f20445596e33","observation_id":"597214ae-edf3-428d-aac1-64c5177508d7","resolution":{"observed_at":"2026-07-30T20:58:37.070428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:58:37.073581Z","title":"Mapping memes to words for multimodal hateful meme classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.073581Z"},"links":{"citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:86ce4eb3709fce7bb2b23f5102227ec33c41d0862204f2ff24ebfd69182aedea","observation_id":"92a8e39d-f56b-487b-90c9-3cb2003d8040","resolution":{"observed_at":"2026-07-30T20:58:37.073581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05612","last_updated":"2023-04-07T00:57:16Z","snapshot_observed_at":"2026-08-01T23:17:00.867406Z","submitted_at":"2022-12-11T21:52:21Z","title":"Multimodal and Explainable Internet Meme Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05612","snapshot_observed_at":"2026-07-30T20:58:37.077724Z","title":"Multimodal and explainable internet meme classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.077724Z"},"links":{"cited_paper":"/paper/2212.05612","citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:096d5ca5985385f7a7877955e237b78dd54c06ca50c446055b43b20286453d23","observation_id":"fe3b8366-e4a8-4ece-be94-cd056d4d4d0d","resolution":{"observed_at":"2026-07-30T20:58:37.077724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:58:37.081190Z","title":"Multimodal religiously hateful social media memes classification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.081190Z"},"links":{"citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:7c923b64da2169c4bd93c93fcd7b289d662cc295359fa340908c725280ae95d6","observation_id":"bb51594c-b494-4b3f-9827-a9de0a66ea79","resolution":{"observed_at":"2026-07-30T20:58:37.081190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:58:37.084729Z","title":"MUTE: A multimodal dataset for detecting hateful memes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.084729Z"},"links":{"citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:5cfafa8a38985cc7e8946903307292641a786d4c487840e47c4733fbc4ff35b9","observation_id":"3b705c5e-b529-4131-9358-98f55b61a4ce","resolution":{"observed_at":"2026-07-30T20:58:37.084729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:58:37.087823Z","title":"A multimodal framework to detect target aware aggression in memes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.087823Z"},"links":{"citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:395e6d707343a254ea389fb6856c0677efc73ba5bbd04744c2c32e3b5a7fead3","observation_id":"8e7abe3d-697b-4558-a865-990f2ca1a5c9","resolution":{"observed_at":"2026-07-30T20:58:37.087823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:58:37.091351Z","title":"Deciphering hate: identifying hateful memes and their targets,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.091351Z"},"links":{"citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:e5d7a56aa67b35a31f9465631837a01d86359527904f2e84498e7b39012da60f","observation_id":"e6f7dadc-167a-495e-a0f9-9a85e1f7b632","resolution":{"observed_at":"2026-07-30T20:58:37.091351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:58:37.094556Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.094556Z"},"links":{"citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:e37eeddc6713e15a59957a0a398177c06daa7b0dee7056235877d69e4388240a","observation_id":"29800500-4838-456f-b621-6c3b5bcb47f6","resolution":{"observed_at":"2026-07-30T20:58:37.094556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T20:58:37.097846Z","title":"Unsupervised cross-lingual representation learning at scale,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T20:58:37.097846Z"},"links":{"citing_paper":"/paper/2607.23493"},"observation_digest":"sha256:72d37279d21e97b7f8c69db24ba5e2afd439a1de3480f55247c9c500624e8f52","observation_id":"d0585c94-15a3-4e32-8729-8e7033d03416","resolution":{"observed_at":"2026-07-30T20:58:37.097846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23493","last_updated":"2026-07-26T06:36:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T18:05:45.950812Z","submitted_at":"2026-07-26T06:36:44Z","title":"Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2607.23493."}