{"as_of":"2026-08-18T23:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:affc0ff493456924219cf83757530c38283a073b236b13794d8f897964c4db8a","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:51:42.939404Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20156/citation-record","integrity":"/paper/2507.20156/integrity","json":"/paper/2507.20156/citation-record.json","paper":"/paper/2507.20156"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T17:51:42.792055Z","title":", Gemini 1.5: Unlocking multi- modal understanding across millions of tokens of con- text, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.792055Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:60851af615729c6b86f0f69f7e0527c39cf9246f286cbdf3ef32d5cacac9399f","observation_id":"0e6b01c7-ae0a-4c47-aef8-eb42e524c7a7","resolution":{"observed_at":"2026-08-15T17:51:42.792055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.773755Z","title":"Wang et al., Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution ,","venue":null,"work_id":"64d52bf7-054d-4439-874e-5c2a6260fb20","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.797227Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:f1adfe59ac83d1288bd51bc5eaf6e8953fddc45b4f68750a63f352ee4a61ab24","observation_id":"e00b4115-514b-4eee-95e4-1bb26842c2bc","resolution":{"observed_at":"2026-08-15T17:51:43.777817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T17:51:42.805659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.805659Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:f5d4aee15549146a2cf720ed88fc8db434ab20c71fd75c8b3eed1462f5ba9cf7","observation_id":"183d1dc8-1e3a-4d5c-be39-1e6d9576aa0c","resolution":{"observed_at":"2026-08-15T17:51:42.805659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T17:51:42.809672Z","title":"Bai et al., Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.809672Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:7b15a4a0d58b6e09beae545054f92a560e98d1aaa9ce69115642e2cc7ca6fc23","observation_id":"c2c8b985-9a1b-4bb4-b3dc-5917fd79b9e6","resolution":{"observed_at":"2026-08-15T17:51:42.809672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.761894Z","title":"LLaV A-onevision: Easy visual task transfer,","venue":null,"work_id":"c326a231-5c99-404e-bf3a-3bdf8cf7553a","year":2025},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.814331Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:8a60020ab983eb66674f38c17a2defb5265b0a55a935d21f62e892684fd1f40f","observation_id":"b1318520-c311-4073-a0d8-7985c669838e","resolution":{"observed_at":"2026-08-15T17:51:43.765837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-15T17:51:42.818265Z","title":"Lu et al., Deepseek-vl: Towards real-world vision- language understanding , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.818265Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:e3c3e007966b60fa62d22c51de5879e4ba86da5d4682f0d83e0ccf2e77b8f6ea","observation_id":"73b8b5eb-d6ea-4da7-9035-8b5ca9246bfb","resolution":{"observed_at":"2026-08-15T17:51:42.818265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.749738Z","title":"Masry et al","venue":null,"work_id":"1bc9119a-c880-4190-8e8d-538cd71e6554","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.822523Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:aa8e5071e5e506741b15bb9c3a6443fe60fd6c69fa4710a5039e3fdbd8362e67","observation_id":"336b6437-7ad8-4a96-aab0-9fafdb0b7ece","resolution":{"observed_at":"2026-08-15T17:51:43.753778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14276","snapshot_observed_at":"2026-08-15T17:51:42.830659Z","title":"Liang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.830659Z"},"links":{"cited_paper":"/paper/2501.14276","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:c4cc7017ab62fed50f9fcfa9e10e3f4a66b5d4da79018101d27f45d2e7c056df","observation_id":"1d86c0e1-6bd8-4667-8769-8edaf95e3ad4","resolution":{"observed_at":"2026-08-15T17:51:42.830659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.01239","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.536878Z","title":"Mplug-owi2: Revolutionizing multi- modal large language model with modality collab- oration,","venue":null,"work_id":"e3f3dffb-fe05-480d-9556-d73feead387e","year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.835619Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:3bd4a1168c5aa54cf7413998de382cf1e3d1f730ea523b4273c42704747c14f1","observation_id":"6b92f115-f401-4d14-ad10-ef1761793569","resolution":{"observed_at":"2026-08-15T17:51:43.543200Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.00356","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.471096Z","title":"Conceptual 12m: Pushing web- scale image-text pre-training to recognize long-tail visual concepts,","venue":null,"work_id":"faf706b7-d417-4f98-bc92-e28159edb537","year":2021},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.839683Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:b094460899791be186625200534420d9ae33cc706e0f76927b201b1a4fb73a07","observation_id":"78af3003-449a-47cc-91f8-2db9ee342ba2","resolution":{"observed_at":"2026-08-15T17:51:43.480475Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-08-16T13:43:37.667967Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-15T17:51:42.843903Z","title":"Li et al., What if we recaption billions of web im- ages with llama-3? 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.843903Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:c2f2384d4a0774d9ff3531c8a99507df37a9f6debb0696e22401cb0db66bf9f0","observation_id":"473a62d3-b1fd-4d9b-b6e9-383c663df6d5","resolution":{"observed_at":"2026-08-15T17:51:42.843903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.737681Z","title":"Obelics: An open web-scale fil- tered dataset of interleaved image-text documents,","venue":null,"work_id":"72017c30-2d05-4ffb-ad1a-d9ef4d61c7df","year":2023},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.848435Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:c512e125da1fecb47d491cc3958cbf9bb1f72c662c3dd92af674cb61c90bc093","observation_id":"34c429a6-d137-4f20-96d0-0f6be4310713","resolution":{"observed_at":"2026-08-15T17:51:43.741786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.725861Z","title":"Bai et al","venue":null,"work_id":"f5767461-5b1c-403c-a475-5b10eef6c0cc","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.852105Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:b84f77ac50409e9dda9277ef0623b004f0e6549b2b3b5c170034288319cdf315","observation_id":"9e104414-5404-4c31-9018-ac5f49acf053","resolution":{"observed_at":"2026-08-15T17:51:43.729804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.889","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.154087Z","title":"Towards efficient visual-language align- ment of the q-former for visual reasoning tasks,","venue":null,"work_id":"02abf214-ed83-4c8a-9206-55dd1108087e","year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.861283Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:ac41b9b48226f23c3f20d1c81fd420eab2c3f50724c0809928384ba3555808c2","observation_id":"0e493f98-bf3c-4af0-b44d-12a222dfb98d","resolution":{"observed_at":"2026-08-15T17:51:43.158871Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.713594Z","title":"Training language models to fol- low instructions with human feedback,","venue":null,"work_id":"fc54aa72-1927-4aaf-bcf6-ffe3c57326e7","year":2022},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.865159Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:4aead06b6410e1704e9b1b515c7af37a504c6cd16444b58397532bc8b19adc65","observation_id":"6e260517-0b60-4f18-a560-8cb159f743b1","resolution":{"observed_at":"2026-08-15T17:51:43.717929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04575","last_updated":"2024-03-05T21:02:33Z","snapshot_observed_at":"2026-08-16T14:28:48.915220Z","submitted_at":"2024-01-09T14:24:29Z","title":"Let's Go Shopping (LGS) -- Web-Scale Image-Text Dataset for Visual Concept Understanding","version":2},"cited_work":{"arxiv_id":"2401.04575","doi":"10.48550/arxiv.2401.04575","metadata_source":"pith","pith_arxiv_id":"2401.04575","snapshot_observed_at":"2026-08-15T18:16:14.067578Z","title":"Let's Go Shopping (LGS) -- Web-Scale Image-Text Dataset for Visual Concept Understanding","venue":"cs.CV","work_id":"d454ec9e-1dc5-4fe0-be56-3b37743f9653","year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.856037Z"},"links":{"cited_paper":"/paper/2401.04575","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:94a0174b0ed8eadf992c9371715d9217fc6755bda885b0974fd0e5d8150c827c","observation_id":"54f10874-2138-4c03-9c82-14b38eb9cb4b","resolution":{"observed_at":"2026-08-15T17:51:43.176356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.688999Z","title":"Lima: Less is more for alignment,","venue":null,"work_id":"ebd03d91-627d-47e8-bd22-9c8cd670329f","year":2023},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.872904Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:a241b282f0f088794712959f4bfc4dca9e67be8b88277904921ed8ece30fcfd8","observation_id":"2ec930d8-ce85-4785-bf34-a4aa211b036f","resolution":{"observed_at":"2026-08-15T17:51:43.693170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.676986Z","title":"Agarwal and D","venue":null,"work_id":"4e3fe269-e83a-42e6-a888-7a74bf9a0fa4","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.876778Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:90c47c2b4344d6e979f0b1cc1178115ed2840e2e06c01a6d018e87427fa98db3","observation_id":"00ccbdd9-15cd-48ed-8bc3-9d6e4dc55e88","resolution":{"observed_at":"2026-08-15T17:51:43.680958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.701015Z","title":"Visual instruction tuning,","venue":null,"work_id":"286471b1-8333-4de8-b6ed-c8eac6a023e7","year":2023},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.868943Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:8534ffa285fdf74670e0694d5d8e77ec24bb15dc0442052c3da92cf61b863b24","observation_id":"ed77cb0e-c99b-4a29-b816-52dd411f3a29","resolution":{"observed_at":"2026-08-15T17:51:43.704893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-17T09:37:14.144521Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-15T17:51:42.888839Z","title":"Liu et al., A survey on hallucination in large vision- language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.888839Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:1b2b8f7637126536e15f607a268f4996603bcb35257faf94f37f2ce9c145175f","observation_id":"9d9c0583-18e0-48b0-a1a4-381266f45c07","resolution":{"observed_at":"2026-08-15T17:51:42.888839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.665160Z","title":"On the origin of hallucinations in con- versational models: Is it the datasets or the models?","venue":null,"work_id":"b9d13acf-3062-46f8-92a7-45428c6ffcfa","year":2022},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.893005Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:b08d9a017a0cfbd1c5998d1f4c3caf92a8a9bc9f2d00962496e427825d80335b","observation_id":"c5d58d02-0272-421e-b5ab-3d5a4059181f","resolution":{"observed_at":"2026-08-15T17:51:43.669088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2502.09969","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.138927Z","title":"48550 / ARXIV","venue":null,"work_id":"8b8647c5-0c04-456f-939a-c15ca0ddf40f","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.880779Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:70f64606d61684b5e9632659de55af84aee8583829a9d90d13e0c3df153ec5e2","observation_id":"4b5aff2c-9fb3-422d-887f-aa0e71838b34","resolution":{"observed_at":"2026-08-15T17:51:43.145209Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12501","last_updated":"2024-02-19T20:08:48Z","snapshot_observed_at":"2026-08-16T14:17:11.528452Z","submitted_at":"2024-02-19T20:08:48Z","title":"Your Vision-Language Model Itself Is a Strong Filter: Towards High-Quality Instruction Tuning with Data Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12501","snapshot_observed_at":"2026-08-15T17:51:42.884682Z","title":"Chen et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.884682Z"},"links":{"cited_paper":"/paper/2402.12501","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:4c1d62674f04f3ad0aa7e50ac399544a2e098807c8a46b0bb76e0c05eeda848d","observation_id":"a5b05a76-f4e4-4ee9-8d8f-eba98670ca9a","resolution":{"observed_at":"2026-08-15T17:51:42.884682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.640631Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language mod- els,","venue":null,"work_id":"19b35705-7fcc-42b9-8b8e-d569be76552b","year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.905045Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:1c64ea3bd04dc308a331a21545a2a587d27fb9ec5c441589cb4ca7e9fe5145dd","observation_id":"9137c9a2-2555-463d-9124-98d294a67a3f","resolution":{"observed_at":"2026-08-15T17:51:43.644770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.628373Z","title":"Conceptual captions: A cleaned, hy- pernymed, image alt-text dataset for automatic image captioning,","venue":null,"work_id":"23efe3d1-ce52-45f8-b176-d834c91ca0cb","year":2018},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.909037Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:e9e1ee5ca2580eacaa150e6cbaecd71181c6529e0bbf59db1e8af92bc99b95e6","observation_id":"b65c4bde-955a-4669-bced-69f5fb7df324","resolution":{"observed_at":"2026-08-15T17:51:43.632535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12067","last_updated":"2026-04-12T14:13:44Z","snapshot_observed_at":"2026-08-17T11:42:02.077158Z","submitted_at":"2023-08-23T11:27:30Z","title":"MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12067","snapshot_observed_at":"2026-08-15T17:51:42.896673Z","title":"Wei et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.896673Z"},"links":{"cited_paper":"/paper/2308.12067","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:16d48018508cc60cd6e630faa842bc45dff1706b0b424dce5fb41b7c9502888f","observation_id":"f842be4f-5590-4ba2-a228-f4a8114b7da0","resolution":{"observed_at":"2026-08-15T17:51:42.896673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.652887Z","title":"Alpagasus: Training a better alpaca with fewer data,","venue":null,"work_id":"3ef3069a-7aac-4d61-b6db-3b9cca7b83f9","year":2024},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.900720Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:db33c8f848f13c0232fd4d54576842e616e3ce90aa9c9b95c8d805348b7bc935","observation_id":"86302a80-cbc6-4715-ac71-616b76a72c2a","resolution":{"observed_at":"2026-08-15T17:51:43.656968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.603378Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":"eb0d4e92-07bb-4bcb-b190-03fe2c04936a","year":2019},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.920881Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:aa6ae0006d48f6101e9ac27f90998026c63c7483cb354ac0e4a8a49f1553af0c","observation_id":"b7cf5628-da59-48db-85ee-ea0ce844e3bc","resolution":{"observed_at":"2026-08-15T17:51:43.607479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.578254Z","title":"A frustratingly simple approach for end-to-end image captioning,","venue":null,"work_id":"65493a18-8e52-4bed-a69b-0288d0f91d03","year":2022},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.928389Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:505a51a1fad4b3dfec8bef3020d2266c4c29cd6ac824370281d02063204659a3","observation_id":"4cd92eee-129b-4164-9e4e-b0d6cd0874c2","resolution":{"observed_at":"2026-08-15T17:51:43.582723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.615623Z","title":"Learning transferable visual mod- els from natural language supervision,","venue":null,"work_id":"cb625e1a-4136-4506-9858-9089d63c3c5e","year":2021},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.912892Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:c627b583c06ac591ab8f46fad191b524e15ded13870c8149ba8b1f9529edaee9","observation_id":"9b75eceb-4c74-4217-bd8a-9a4b8eece9c6","resolution":{"observed_at":"2026-08-15T17:51:43.620012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T17:51:42.916590Z","title":"Dosovitskiy et al., An image is worth 16x16 words: Transformers for image recognition at scale , 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.916590Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:11f7364ad6b2024bf7cdf0bcc81bb64978767abba529b7725f6c87cd794dee45","observation_id":"5a46c7e5-1d23-4691-88a8-cc08dfe4f5cf","resolution":{"observed_at":"2026-08-15T17:51:42.916590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.591082Z","title":"Available: https://cdn.openai","venue":null,"work_id":"f6592876-619b-4227-b06a-a1c05df63bb4","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.924572Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:97c985264e8aa86a0394a7cd97e90c87b9fece83597153c1b177e8110d7d59e5","observation_id":"ec5e046e-f3f5-49b7-8e2c-91e7c739fae6","resolution":{"observed_at":"2026-08-15T17:51:43.595346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.565644Z","title":"A survey on enhancing image caption- ing with advanced strategies and techniques,","venue":null,"work_id":"9da4b3a8-a70d-4c23-a45d-4e0bf2d98a49","year":2025},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.932021Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:145567d705565782ff09f562bbe7eab7192a5944e475a3ab94e84e39efa5b7e4","observation_id":"a81406a3-565c-48ea-904b-866e719a8904","resolution":{"observed_at":"2026-08-15T17:51:43.569802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.551481Z","title":"SciPy 1.0: Fundamental Algorithms for Scientific Computing in Python,","venue":null,"work_id":"e472e4cb-6113-4790-b258-1defad90d5f4","year":2020},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.939404Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:b52210668d93b49ee0191710bbb56a23775ea571a25f5de4bf9fc41e2e5954c9","observation_id":"2a3bc4dd-9bb9-48eb-ad34-b5cb2aa1b190","resolution":{"observed_at":"2026-08-15T17:51:43.555538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.05919","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.393371Z","title":"32604 / cmes","venue":null,"work_id":"c1d1c1ae-864e-4ddc-86b6-2436c271ca0b","year":2025},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":1506,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.935633Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:c2999e3ad6336db154aae2eb71d2d6b6601d2889a39eccf347af2d7016f16c3b","observation_id":"57702283-bbd4-4e3a-b763-cefa40cf6a70","resolution":{"observed_at":"2026-08-15T17:51:43.399739Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T17:51:42.801311Z","title":"48550 / ARXIV","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.801311Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:f201f3561f8ee0a22b8cffc8657e1c95498f1fcfc67a3ba2b44c7662199c2ca2","observation_id":"a99d609a-3c26-45d0-afd2-016f4732510b","resolution":{"observed_at":"2026-08-15T17:51:42.801311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2502.01341","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:43.256253Z","title":"48550 / ARXIV","venue":null,"work_id":"ce6d83cd-4420-4bc6-8ead-a4ff6cd6290c","year":null},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.826469Z"},"links":{"citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:dcb1ea8f5312beeabc9685f8c68c89ffa5b4b6ab941fe2ef72129531e83d135f","observation_id":"bb5a050c-5f47-489a-928f-c215d8208db3","resolution":{"observed_at":"2026-08-15T17:51:43.260921Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":6,"verified_fuzzy":19},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2507.20156."}