{"as_of":"2026-08-18T22:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:647265b2fc93191f63e20ed493f4af17c170d5b706ba299640047fb81d0d9e9e","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:04:20.574759Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T20:02:56.057102Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:08:55.138666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"cited_work":{"arxiv_id":"2509.10278","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10278","snapshot_observed_at":"2026-07-03T20:08:55.138666Z","title":null,"venue":null,"work_id":"f08e95d4-967e-472c-af47-b4b2f66210f9","year":2025},"citing_paper":{"arxiv_id":"2607.01442","last_updated":"2026-07-01T20:05:46Z","snapshot_observed_at":"2026-08-12T20:54:14.060135Z","submitted_at":"2026-07-01T20:05:46Z","title":"From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-03T20:02:56.057102Z"},"links":{"cited_paper":"/paper/2509.10278","citing_paper":"/paper/2607.01442"},"observation_digest":"sha256:a51aecab2ee1eee5faff2689b1d7ca9af9f8174f2a573272e165b3c2b33fc907","observation_id":"26fe4bc7-e59a-4e4e-acee-314a42cff1f3","resolution":{"observed_at":"2026-07-03T20:08:55.141276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.10278/citation-record","integrity":"/paper/2509.10278/integrity","json":"/paper/2509.10278/citation-record.json","paper":"/paper/2509.10278"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T18:04:18.054749Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.054749Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:65420df372c59882255e4f0fa6ae0a5dfd74618fd4edc44a603e5aad3a366c4b","observation_id":"70313364-3ac7-4635-bfda-c39daa62fee4","resolution":{"observed_at":"2026-08-04T18:04:18.054749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:18.254757Z","title":"Textdiffuser- 2: Unleashing the power of language models for text rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.254757Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:1cf875b916646c7a1a1a658f40c55f68c5b097080568de14c6b1f6569e9f3c5b","observation_id":"9c311dd9-9dc4-4572-9b57-9db1271ac223","resolution":{"observed_at":"2026-08-04T18:04:18.254757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:18.425371Z","title":"Image manipulation detection by multi-view multi-scale supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.425371Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:d74c249581c4b825e1f568f584f83b19b214e724bbaf16d30e8f0f5c9c1741e2","observation_id":"2053abec-4f97-4f26-b31d-20405ddcceb2","resolution":{"observed_at":"2026-08-04T18:04:18.425371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:18.518832Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.518832Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:8a01749d67c86d214cbda44120efe136a51047414ed2c0c37e268547706f38d9","observation_id":"af2f30ca-4554-4e2a-9bc9-d1c5b424d0b3","resolution":{"observed_at":"2026-08-04T18:04:18.518832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:18.632298Z","title":"On the detection of digital face manipulation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.632298Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:f4d532fbc0b2023e44da33d69fc812d7164a2bb915e1cf4d7177eecfd8095cb9","observation_id":"67b6ed52-900b-46f3-8cb4-77cb1ff70fbf","resolution":{"observed_at":"2026-08-04T18:04:18.632298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:18.712784Z","title":"Mvss-net: Multi-view multi- scale supervised networks for image manipulation detection.IEEE Transactions on Pattern Anal- ysis and Machine Intelligence, 45(3):3539–3553, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:18.712784Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:6d82f1e8dfab39d0c705095d96486b1b9660ff21148407e314e9a6e0a28075b2","observation_id":"f10857ed-5151-46ae-9b21-d3ca7fa3f3a6","resolution":{"observed_at":"2026-08-04T18:04:18.712784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:19.004846Z","title":"Casia image tampering detection evaluation database","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.004846Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:58eca8afc981773388c5cae6876c9ab94f455b5f7dfe1254f4cd885a35b2d3f8","observation_id":"9d389dfa-c654-422d-acde-acf72991fc14","resolution":{"observed_at":"2026-08-04T18:04:19.004846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11697","last_updated":"2024-05-21T15:35:26Z","snapshot_observed_at":"2026-08-18T17:00:35.516082Z","submitted_at":"2024-05-19T23:05:53Z","title":"AMMeBa: A Large-Scale Survey and Dataset of Media-Based Misinformation In-The-Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11697","snapshot_observed_at":"2026-08-04T18:04:19.084829Z","title":"Ammeba: A large-scale survey and dataset of media-based misinformation in-the-wild.arXiv preprint arXiv:2405.11697, 1(8), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.084829Z"},"links":{"cited_paper":"/paper/2405.11697","citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:a369d1784536c081a363dbb68ce2c4dfc80d3db3a17e0644b7c043498fd5fc01","observation_id":"ee526ebb-f2ea-4c8b-9b16-f86c92c165db","resolution":{"observed_at":"2026-08-04T18:04:19.084829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T18:04:19.213306Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.213306Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:85af672b8372ce1417fb85a4cfff1588dfa77aac89bea43829f7fb27cc63f525","observation_id":"3be553d2-7ed7-42da-8b78-37e74bb50334","resolution":{"observed_at":"2026-08-04T18:04:19.213306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:19.444751Z","title":"Tru- for: Leveraging all-round clues for trustworthy image forgery detection and localization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.444751Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:2c590ddd8059fcb363d3c6f08534d6e3a773c9ae0b046b765b511332dfc8ab11","observation_id":"364d1e11-953a-4e0f-8f92-19b467d019fd","resolution":{"observed_at":"2026-08-04T18:04:19.444751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:19.577394Z","title":"Hier- archical fine-grained image forgery detection and localization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.577394Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:746b288873be143c735183b1d0d571f34520a6771ff6858ed9f8db632bf2c12c","observation_id":"de5a0f2b-6b45-472e-8df7-e002ff5e1642","resolution":{"observed_at":"2026-08-04T18:04:19.577394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04292","last_updated":"2025-06-25T21:47:50Z","snapshot_observed_at":"2026-08-18T13:07:39.026728Z","submitted_at":"2024-12-05T16:12:25Z","title":"SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04292","snapshot_observed_at":"2026-08-04T18:04:19.694757Z","title":"Sida: Social media image deepfake detection, localization and explanation with large multimodal model.arXiv preprint arXiv:2412.04292, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.694757Z"},"links":{"cited_paper":"/paper/2412.04292","citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:03ac266310eb58995c2b9a3997b5d98029d9341a62fdc34ca87635a1bf69810f","observation_id":"8bc15881-3022-4427-8dcc-7fea0464ccfd","resolution":{"observed_at":"2026-08-04T18:04:19.694757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:19.870008Z","title":"The point where reality meets fan- tasy: Mixed adversarial generators for image splice detection.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:19.870008Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:7809d2c45e464a149db1b879e083a3fb3ed13eb7b189395ff0eb9e5ca1eec961","observation_id":"319047f5-1dad-4a24-b3e9-5dafa75af0af","resolution":{"observed_at":"2026-08-04T18:04:19.870008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:20.064836Z","title":"Exploring chatgpt for face presentation attack detection in zero and few-shot in-context learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:20.064836Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:ec8b3a5dc105f6afa52633b570230bf89c643cb0a47ebdf2c361262209cbc918","observation_id":"06f360f2-0ac5-4bdd-8eb3-c4d96ac76b3d","resolution":{"observed_at":"2026-08-04T18:04:20.064836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20808","last_updated":"2025-07-28T13:20:18Z","snapshot_observed_at":"2026-08-17T19:17:31.008664Z","submitted_at":"2025-07-28T13:20:18Z","title":"FantasyID: A dataset for detecting digital manipulations of ID-documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20808","snapshot_observed_at":"2026-08-04T18:04:20.314744Z","title":"Fantasyid: A dataset for detecting digital manipulations of id-documents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:20.314744Z"},"links":{"cited_paper":"/paper/2507.20808","citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:ef57f718cdf084f943ec13d71cce8028d0ba6d8e87e52c01c6a27749e4e7bbfa","observation_id":"fb3976a8-f6d0-4f6d-a82f-60e8bfa54103","resolution":{"observed_at":"2026-08-04T18:04:20.314744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:20.437130Z","title":"Cat-net: Compression artifact tracing network for detection and localization of image splicing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:20.437130Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:edce7ca9b8165810955d028545fbfd6eb7facc62f03123f5c54fc3e6ebcb89d3","observation_id":"99a6db89-cbf4-4995-9191-9f09dc58bc09","resolution":{"observed_at":"2026-08-04T18:04:20.437130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:04:20.574759Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:04:20.574759Z"},"links":{"citing_paper":"/paper/2509.10278"},"observation_digest":"sha256:cca7d0be1bf13368bf7b5263ff9273889499528c698c61a16e5e6f54ceb0cfb7","observation_id":"81f44cdf-b203-4b89-aef2-6b9571f8938c","resolution":{"observed_at":"2026-08-04T18:04:20.574759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10278","last_updated":"2025-09-12T14:20:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T17:01:09.815735Z","submitted_at":"2025-09-12T14:20:29Z","title":"Detecting Text Manipulation in Images using Vision Language Models"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2509.10278."}