{"as_of":"2026-08-18T02:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0340ebb82067eb2db116d79f5bdd2ad418f9510d213a9624a6345fb9d63bee2e","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:26:07.044700Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.10455/citation-record","integrity":"/paper/2502.10455/integrity","json":"/paper/2502.10455/citation-record.json","paper":"/paper/2502.10455"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.749718Z","title":"Open- domain, content-based, multi-modal fact-checking of out- of-context images via online resources","venue":null,"work_id":"31a49e0d-a0f5-4913-a9cb-e119055b1d0b","year":2022},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.829391Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:37454431f2f4905ac6c9a871ee3bbe3f385ce69107af1d50440a1face3f4c9f8","observation_id":"da7244d4-12df-4b65-a2cd-39a119e5967c","resolution":{"observed_at":"2026-08-08T10:26:07.754405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T10:26:06.834828Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.834828Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:615babd1e0909fe847b469fdb7827f94e2f46e9b933fd93901ab1eab651ebc13","observation_id":"12dbdc21-21df-4d41-8ec7-784761599e50","resolution":{"observed_at":"2026-08-08T10:26:06.834828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.735646Z","title":"Cos- mos: Catching out-of-context image misuse using self- supervised learning","venue":null,"work_id":"e2b28bc8-79dc-44e4-9c81-ef7b636b273f","year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.839738Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:8eb3460d7fa8697be8d016650fc584973cd19a342a7b8e1854f9cf74a5a8b6b5","observation_id":"076f4d84-b5f8-4884-93ed-1242b9255301","resolution":{"observed_at":"2026-08-08T10:26:07.740343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.721340Z","title":"The making of an ai news anchor—and its implications","venue":null,"work_id":"ac475411-70b8-45bd-8944-f15a0175d9cf","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.844509Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:16caffbf950b0cba8f3da5259d29ea778309b4d2de5ef6834a73d259cdcd9b2e","observation_id":"6cf0192b-742b-4265-8638-ef87c982282e","resolution":{"observed_at":"2026-08-08T10:26:07.726169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.707435Z","title":"Lion: Empowering multimodal large language model with dual-level visual knowledge","venue":null,"work_id":"60a75c56-9152-4267-800c-d671d2d02977","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.849516Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:abb96d5f9797e98bf8a19179c604b7619a956fbde42019c3753512ebdaba36ff","observation_id":"d9499662-5071-4ceb-a3dc-f09f5d0b6b45","resolution":{"observed_at":"2026-08-08T10:26:07.712122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.693872Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"321e2008-348e-4792-b679-f8a7f0283c58","year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.854156Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:78ede75964ef751414339a10596bc44fc800a9fe7f1d18a62b2916c9b0d442c2","observation_id":"5e903869-4b9f-4aab-bb4a-aaaf9a0b3286","resolution":{"observed_at":"2026-08-08T10:26:07.698202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.679501Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"f2427029-a22d-4598-957c-fbb824201fc2","year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.859621Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:517c93c364c42f424bc9123907d21baeb6faba62801179d54ae6f3f42becce26","observation_id":"d3f0b995-89ca-4f4e-9b6f-b2cd93992ae4","resolution":{"observed_at":"2026-08-08T10:26:07.684275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.665412Z","title":"Overview of the grand challenge on detect- ing cheapfakes at acm icmr 2024","venue":null,"work_id":"afaf23a1-7f6b-4709-bbaa-ebe8fdb8cbe5","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.864779Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:0e59b05af9e41418fad33a22eec16ee8609328d76115ee2bbb5894318f04c0d6","observation_id":"e5830e2e-561e-4717-9c82-a0cfac355bd2","resolution":{"observed_at":"2026-08-08T10:26:07.669895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.651448Z","title":"Flashattention-2: Faster attention with better par- allelism and work partitioning","venue":null,"work_id":"c2713d21-aa71-4340-8d3d-bc9a67719195","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.869457Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:271294c2e9d563035b3fc2c6a6b3bf32619f7086bbd9415cf0fde6df9a3111e6","observation_id":"addb8d05-0314-40ae-8404-a1248ae163bf","resolution":{"observed_at":"2026-08-08T10:26:07.655975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07430","last_updated":"2024-08-08T07:34:50Z","snapshot_observed_at":"2026-08-17T15:24:22.513966Z","submitted_at":"2024-06-11T16:34:02Z","title":"Learning Domain-Invariant Features for Out-of-Context News Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07430","snapshot_observed_at":"2026-08-08T10:26:06.874045Z","title":"Learning domain-invariant features for out- of-context news detection.arXiv preprint arXiv:2406.07430,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.874045Z"},"links":{"cited_paper":"/paper/2406.07430","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:90b80baa717f078a2129681df6dd295bb3032881c86a132e52e1e6583ac2030b","observation_id":"aacf91a0-8625-4576-b29b-9adea98369c2","resolution":{"observed_at":"2026-08-08T10:26:06.874045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.637604Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"72c3596b-5eba-4074-9d86-7f0ec0d1904b","year":2022},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.879055Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:a2321f8044b2c8b65c302bf353a1c7134155373b8a40bc0474734c9c37bda8fb","observation_id":"195ca009-89b6-47b9-b0d1-c4f5d62d35b0","resolution":{"observed_at":"2026-08-08T10:26:07.642053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-08T10:26:06.883547Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.883547Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:18c5a2ab1d16d81496df2e67caf6cd0b891009c7926bdb69f729d841b07de553","observation_id":"dedef171-81ef-4575-9580-0b905633875d","resolution":{"observed_at":"2026-08-08T10:26:06.883547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.623471Z","title":"Hallucination augmented contrastive learn- ing for multimodal large language model","venue":null,"work_id":"e5a716c0-1fea-4103-94fd-b88e59752ec5","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.888309Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:7a0f19787c497f114fa53aa2d8f221f462dff0f227b9245e2fc60e4f2618fa5c","observation_id":"3351443d-8d87-4db0-8fab-4a142f605977","resolution":{"observed_at":"2026-08-08T10:26:07.628103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.609252Z","title":"Llava-vsd: Large language-and-vision as- sistant for visual spatial description","venue":null,"work_id":"3b656e60-0fbe-4e6f-bc72-fddf546ef3da","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.892845Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:089f3632518c9081ef1812756a918c4ff76f93c1712c3bd97d6223a513eecfe5","observation_id":"c6eabe9b-19c0-4e6f-837b-987f44a327d9","resolution":{"observed_at":"2026-08-08T10:26:07.613928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.595177Z","title":"Geochat: Grounded large vision-language model for remote sensing","venue":null,"work_id":"50b6c035-bfc3-41ab-a1b5-db0718c30409","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.897390Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:47950d64872684b75817b01783256ffecb3a1e7a9d0d2b83700758517ddd388c","observation_id":"c74c63a6-3803-41f8-8c27-acc029415027","resolution":{"observed_at":"2026-08-08T10:26:07.599743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.580779Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"0b7cba07-578c-48d7-b379-4c062374b16d","year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.901779Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:1f0d515cc2f6d076ab34c53feba1204d59acf513c000a337bba24d9098a9ba37","observation_id":"50fb0ef5-844d-4144-9715-6519543053f5","resolution":{"observed_at":"2026-08-08T10:26:07.585607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-08T10:26:06.906239Z","title":"Visualbert: A simple and perfor- mant baseline for vision and language","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.906239Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:584b2a551a4706c5ca8690aa35089e982f92b8e30bc23d8d58a533a844f1d4fe","observation_id":"602fbcfa-73a7-4b35-aa63-dcf350a30e69","resolution":{"observed_at":"2026-08-08T10:26:06.906239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00045","last_updated":"2025-07-26T02:37:03Z","snapshot_observed_at":"2026-08-16T14:25:32.940040Z","submitted_at":"2024-01-22T15:08:19Z","title":"Detecting Multimedia Generated by Large AI Models: A Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00045","snapshot_observed_at":"2026-08-08T10:26:06.910876Z","title":"Detecting multimedia generated by large ai models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.910876Z"},"links":{"cited_paper":"/paper/2402.00045","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:301284309282ece9e51c2758d2e7111a24d5e20dc23daf34217ee62272c4087d","observation_id":"087827b0-039e-419f-9c50-78a2dac444ba","resolution":{"observed_at":"2026-08-08T10:26:06.910876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.566084Z","title":"Forgery-aware adaptive transformer for generalizable synthetic image detection","venue":null,"work_id":"21ad8457-8a46-47eb-a0ae-d7620dbfdbdf","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.915749Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:4e0bae2ed17a7386f5517fb1aab2966b31d58b15220b34e3bb69726d4cb3bcdc","observation_id":"fd160b05-45e3-4d22-94fc-d8ab4c24f6c8","resolution":{"observed_at":"2026-08-08T10:26:07.570719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.551957Z","title":"Fka-owl: Advancing multimodal fake news detection through knowledge-augmented lvlms","venue":null,"work_id":"5761da15-cd6a-4dfe-bf12-2229a74de893","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.920370Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:6e78a38dabdf1575fa2637dfd25b1da1ce144379d2c6cde735f8276ae946a204","observation_id":"f585c5cc-a1df-4183-ad1a-0e81ffb73163","resolution":{"observed_at":"2026-08-08T10:26:07.556515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-08T10:26:06.925137Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.925137Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:21862c6d2fdc24e56fc38911de4fad84901fe33d318d869e25b9235bb4a09bfb","observation_id":"56a76775-cbc6-4a92-8d8b-877449e3d486","resolution":{"observed_at":"2026-08-08T10:26:06.925137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.538003Z","title":"Newsclip- pings: Automatic generation of out-of-context multimodal media","venue":null,"work_id":"14ca7d9e-47b3-4010-8b1d-f4c45cb90bce","year":2021},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.930150Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:1d41070b7b674345670f5246ae45c3e0ff5c0e7ace5f847ac19b4ef70ac5be82","observation_id":"94afc5ac-3f8c-4817-946a-52e6b92d309e","resolution":{"observed_at":"2026-08-08T10:26:07.542508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.523467Z","title":"Safe: Self- attentive function embeddings for binary similarity","venue":null,"work_id":"f7560c73-07c4-4d64-bc5a-278aa2efee0d","year":2019},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.934812Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:94d6d4a592981b1f2a9098ca674e8530e908abffdcc03b524ddfc00a46ea10f9","observation_id":"668b4332-5460-49e9-a697-f6bda6838324","resolution":{"observed_at":"2026-08-08T10:26:07.527957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.509333Z","title":"Self-supervised distilled learning for multi-modal mis- information identification","venue":null,"work_id":"187241d2-4be4-4f3b-82fc-a9926873db77","year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.939319Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:a5ec026dbdae936a27578382958fe83c57adda671e72df77327926fbbabca9ff","observation_id":"f7f7073b-0b0e-4a55-bd87-3212ec1844b5","resolution":{"observed_at":"2026-08-08T10:26:07.513957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.495014Z","title":"The covid-19 ‘info- demic’: A new front for information professionals","venue":null,"work_id":"92c6406b-8b41-4747-adcf-445c5bc529e0","year":2020},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.943909Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:041a813aae746fdb1f97be2bee3c6e5eb26e7312e04bb7edea4a71bfb4615cf2","observation_id":"7d36eec4-14c7-4bfc-810a-6d0b32bde645","resolution":{"observed_at":"2026-08-08T10:26:07.499754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.480742Z","title":"Training lan- guage models to follow instructions with human feedback","venue":null,"work_id":"5e525dae-932e-4e91-ab0d-fcc39173737b","year":2022},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.948361Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:bc4be409ce2459984d5951d78b15f262aac365d5c29ff848e2c44e9abacf46d2","observation_id":"cd0ab88d-6208-466a-8a41-8fd1c6d6b15b","resolution":{"observed_at":"2026-08-08T10:26:07.485579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.466488Z","title":"Synthetic mis- informers: Generating and combating multimodal misinfor- mation","venue":null,"work_id":"b0932f1f-131f-4665-b727-5df6ce2669d8","year":null},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.952817Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:1f900b03ebac4aeda75a7d8b81b7d42d1384508cf7740c3ef7318f475f644c63","observation_id":"e1311823-b2eb-4590-9452-ee24f93afdcc","resolution":{"observed_at":"2026-08-08T10:26:07.471198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09939","last_updated":"2024-03-07T11:13:23Z","snapshot_observed_at":"2026-08-16T14:42:39.786810Z","submitted_at":"2023-11-16T14:43:45Z","title":"RED-DOT: Multimodal Fact-checking via Relevant Evidence Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09939","snapshot_observed_at":"2026-08-08T10:26:06.957533Z","title":"Red-dot: Multimodal fact-checking via relevant evidence detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.957533Z"},"links":{"cited_paper":"/paper/2311.09939","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:63d8de97914271ee9ca090a549dd53e70befe938f8a0d759577719bf60708700","observation_id":"9674be51-8cb6-4987-bfec-f8ed46716e23","resolution":{"observed_at":"2026-08-08T10:26:06.957533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.451453Z","title":"Verite: A robust benchmark for multimodal misinformation detection accounting for unimodal bias","venue":null,"work_id":"643ee144-fa0a-4554-b0a9-519f009673b9","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.962343Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:a68a8e04f36c79fcd006728ab4ef51ed7d87f34569c314ddb8dba685b7e3979f","observation_id":"cc2a5a89-bbbb-4557-aac0-13b156eddfda","resolution":{"observed_at":"2026-08-08T10:26:07.456485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.435749Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"446817db-dd98-4149-9759-740732224b36","year":null},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.967084Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:e2af00e244e9f0daf017f45ea80d16218276800da27a37d4ebf9b1c1a6fb33eb","observation_id":"274f3d7d-d63d-4ebc-95ca-d4b3277935f2","resolution":{"observed_at":"2026-08-08T10:26:07.440769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.421030Z","title":"Sniffer: Multimodal large language model for explainable out-of-context misinformation detection","venue":null,"work_id":"70f54201-d806-40c6-bc8f-bf7d431480ff","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.971680Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:8917036f80dd2f9d1416c115475a6b0437b8e962045e305122224000dde73994","observation_id":"12024270-4c5c-4f3b-970a-bd288e81a68e","resolution":{"observed_at":"2026-08-08T10:26:07.425915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.406017Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"6222c3da-3bfa-4e8e-a734-1586842e960c","year":2021},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.975790Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:6a842840fd0b04ac7b696d1fd9669a1ec0e14f4dadf72762698c372c72846bef","observation_id":"c18039b1-263e-4165-b122-6f819e0e0a03","resolution":{"observed_at":"2026-08-08T10:26:07.411010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.391075Z","title":"Detecting and grounding multi-modal media manip- ulation and beyond","venue":null,"work_id":"8e3563b0-448c-40c7-a0ac-675c5dcfe768","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.980237Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:37530c223d96892b09d80c6f0c10129234582361e7607b4b03aae96fb2f7a51a","observation_id":"6e120eb2-d660-435f-b559-74f30e9fedca","resolution":{"observed_at":"2026-08-08T10:26:07.395788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.376205Z","title":"Prompt- ing large language models with answer heuristics for knowledge-based visual question answering","venue":null,"work_id":"c3a3fe8d-21ed-4c9e-b235-8cd29260da81","year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.984509Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:f2c3a3a2b801ae0c6e07bc9c3098f3c191f0d3011949b49ab2c6d40236163515","observation_id":"47747608-d2f3-4f64-a43b-e6fdbc90cba7","resolution":{"observed_at":"2026-08-08T10:26:07.381329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.361976Z","title":"Multimodal misinformation detection using large vision- language models","venue":null,"work_id":"d157d733-7c1b-4e85-9278-2e37722b1464","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.988932Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:38801977b628f20b776a64ebd94d10d324b31bfffb2727977e51291d00be8698","observation_id":"0b71bf1d-d63c-4da1-a68e-422a5cfe77c4","resolution":{"observed_at":"2026-08-08T10:26:07.366648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.347186Z","title":"Deepface: Closing the gap to human-level perfor- mance in face verification","venue":null,"work_id":"d2a04f49-2ea8-4a2c-8e6e-94809a3f1d74","year":2014},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.993405Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:8682e192b375d8535c3ed1f7b45da8989fa7f4cc36bb0380d98e5ff92dba9379","observation_id":"97bda4d0-259b-47cb-8fbd-6716c8186c62","resolution":{"observed_at":"2026-08-08T10:26:07.351982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T10:26:06.998058Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:06.998058Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:b658d2d99f4d7404dda1ff470f51ca93c7c3e39ad31497f9ce649191a5affa24","observation_id":"bda2875c-5d51-4610-ade8-7bdcb4136036","resolution":{"observed_at":"2026-08-08T10:26:06.998058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14171","last_updated":"2024-04-08T08:30:06Z","snapshot_observed_at":"2026-08-16T14:07:47.639323Z","submitted_at":"2024-03-21T06:47:28Z","title":"MMIDR: Teaching Large Language Model to Interpret Multimodal Misinformation via Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14171","snapshot_observed_at":"2026-08-08T10:26:07.002668Z","title":"Mmidr: Teaching large language model to interpret multimodal mis- information via knowledge distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:07.002668Z"},"links":{"cited_paper":"/paper/2403.14171","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:1b06fa99916dab5b7f382b6c3b169d491ce6dd44542a4f4509ba9cebed5cc8ce","observation_id":"34758a58-a33d-4827-a770-a8ff29439a56","resolution":{"observed_at":"2026-08-08T10:26:07.002668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-08T10:26:07.007446Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:07.007446Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:7b27a160f79aeb9bb0e34ea7b85044160b917821e6ab511995861d00aeacb993","observation_id":"7bc064fb-7fee-4345-912b-fc121e24cd36","resolution":{"observed_at":"2026-08-08T10:26:07.007446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.331378Z","title":"Eann: Event ad- versarial neural networks for multi-modal fake news detec- tion","venue":null,"work_id":"8ac10687-62d6-46c0-96ea-399c766ec274","year":2018},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:07.011851Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:c5942ea225f57167c5a0458eb3f4b330ed37cf18a1287181b3035b9e5d1a4e5f","observation_id":"1fa5e05f-327f-4cdc-8acf-f3e264ea24df","resolution":{"observed_at":"2026-08-08T10:26:07.336434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.315271Z","title":"Cotkr: Chain-of-thought en- hanced knowledge rewriting for complex knowledge graph question answering","venue":null,"work_id":"92bdb7be-beab-4d37-98c7-351bea15c3f4","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:07.016500Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:37171504838a22f668b6224e0c5693904d2814d8365c0f1226d8e045ee4b407c","observation_id":"c707cd85-7067-4c60-84d1-3410ad79982a","resolution":{"observed_at":"2026-08-08T10:26:07.320163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.300066Z","title":"Gpt4tools: Teaching large language model to use tools via self-instruction","venue":null,"work_id":"d7692c99-297d-4e8c-8efe-1c641d7e770b","year":2024},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:07.020953Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:ab14174fea7f473b0dde6cd69dfdf6860e2754e57190f0f2a1a7c8a34c85b82e","observation_id":"792f0807-69fa-4000-9d5c-5cb7bf0c36e5","resolution":{"observed_at":"2026-08-08T10:26:07.305004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-08T10:26:07.025551Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:07.025551Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:d1add75dd40cf33ee12682c30752ec6c067bfb437bd173c2572d7b741d99946b","observation_id":"37208d4e-2ab3-4c3f-a367-2e30fa40b07a","resolution":{"observed_at":"2026-08-08T10:26:07.025551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.284554Z","title":"Support or refute: Analyzing the stance of evidence to detect out-of-context mis-and disinformation","venue":null,"work_id":"5eeddc85-c5b7-4bcc-ad34-5c2710b08e17","year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:07.030701Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:e3a015eb0e8fdd09b234498f968b5e182af4212ea54e6b3bc4589701fc1a331e","observation_id":"ebc824b6-1469-43bb-b151-aa9020aeed03","resolution":{"observed_at":"2026-08-08T10:26:07.289568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.269534Z","title":"Ecenet: Explainable and context- enhanced network for muti-modal fact verification","venue":null,"work_id":"61a33ef1-9a19-4f95-b80a-ee9c5af02538","year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:07.035834Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:0265de79fb7cca7f76f7df19f8bd64cd03a517bd00212f3023567fa9ed92d8cd","observation_id":"01ff7614-9724-40cc-8a05-92f3f4a24071","resolution":{"observed_at":"2026-08-08T10:26:07.274403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:26:07.251383Z","title":"Aligning instruction tasks unlocks large language models as zero-shot relation extractors","venue":null,"work_id":"61941785-c8a8-4d48-abb7-b3bcb8a3b8a4","year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:07.040260Z"},"links":{"citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:5d33568b05b4db5006e0dea678b935195c62165b871447adf6dbe61738114aa8","observation_id":"f16a6a31-e3db-476f-a4f5-7fd877591e08","resolution":{"observed_at":"2026-08-08T10:26:07.258453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07633","last_updated":"2024-04-05T23:39:52Z","snapshot_observed_at":"2026-08-16T15:40:12.286459Z","submitted_at":"2023-04-15T21:11:55Z","title":"Interpretable Detection of Out-of-Context Misinformation with Neural-Symbolic-Enhanced Large Multimodal Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07633","snapshot_observed_at":"2026-08-08T10:26:07.044700Z","title":"Detecting out-of-context multimodal misinformation with interpretable neural-symbolic model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T10:26:07.044700Z"},"links":{"cited_paper":"/paper/2304.07633","citing_paper":"/paper/2502.10455"},"observation_digest":"sha256:d6c76b442968dbbb009c2ada27b59788079dd39ac29a8cfb5f0a124d869383eb","observation_id":"d5c53b28-d1fa-436c-92ec-d200279a87b0","resolution":{"observed_at":"2026-08-08T10:26:07.044700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10455","last_updated":"2025-02-12T04:25:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T15:25:11.387492Z","submitted_at":"2025-02-12T04:25:14Z","title":"E2LVLM:Evidence-Enhanced Large Vision-Language Model for Multimodal Out-of-Context Misinformation Detection"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2502.10455."}