{"as_of":"2026-08-10T11:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0efdcdfd950cb3ac61007cdd2d56a3440c05f0c243300768a9c836de0d76ba48","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:45:53.015838Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04699/citation-record","integrity":"/paper/2507.04699/integrity","json":"/paper/2507.04699/citation-record.json","paper":"/paper/2507.04699"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:45:51.395705Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:51.395705Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:630a251689673462c187ac4dfa003dc6338402c83677ebfc9ba21badfd69d946","observation_id":"e541e223-0112-4f2b-bbc9-a9d01ba6a773","resolution":{"observed_at":"2026-08-06T19:45:51.395705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.562709Z","title":"Vismin: Visual minimal-change understanding","venue":null,"work_id":"3b35319e-49da-4a79-a83c-dc4e89c8d12b","year":2025},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:51.925349Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:c6484e03aeb51d8f9bf0f2ac0895145aa451b47c02c4215cd2681ac465c8e518","observation_id":"227d747f-b29e-408f-a3b9-4f62ce9cb1cb","resolution":{"observed_at":"2026-08-06T19:45:53.566352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T19:45:52.329853Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.329853Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:32c97d6490a0c7a398ac7392df70119b755305c45ea2861a3b732519550e5631","observation_id":"3880f207-f9cf-4cb5-b486-27be3270d16f","resolution":{"observed_at":"2026-08-06T19:45:52.329853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-06T19:45:52.383239Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.383239Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:702e0cb1340a83bd323c7605d66b30e7c0a7d3b14dacfafdfb4d5febda00c139","observation_id":"1c97579e-5679-49a4-bffb-f94465bededd","resolution":{"observed_at":"2026-08-06T19:45:52.383239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.551638Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip","venue":null,"work_id":"9f804f36-f278-4845-975b-84ca8f4f4dda","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.413537Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:bc45ec2aa5e7871bf43c67d3907bcff9ef3f983b8fb140a7e01ef2811ecc0c62","observation_id":"9a65d044-fa8b-44fe-9df2-d56f09da7c57","resolution":{"observed_at":"2026-08-06T19:45:53.555147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.539268Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"2453a90f-169b-4220-b944-41c3a4740c29","year":2020},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.487593Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:7d303d09be7349165b112bcce53f852955094e57c4cbf405de722b9651789c44","observation_id":"92458099-43b3-46b0-9043-596746f5c15e","resolution":{"observed_at":"2026-08-06T19:45:53.543996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T19:45:52.563298Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.563298Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:ba1485f5fda614e80de2aaf49cc404f7e842d128379da1b8944d3fbfaa3e1120","observation_id":"3f519064-4f4e-4d59-9604-802108f68bf0","resolution":{"observed_at":"2026-08-06T19:45:52.563298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-06T19:45:52.624039Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.arXiv preprint arXiv:2312.14238, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.624039Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:2f01d53ecd14a78a7e742f68160b75801ce939d2e3da36121be05e32f2be6878","observation_id":"d1ed6828-d923-4682-b1cd-7e32a88ecf1c","resolution":{"observed_at":"2026-08-06T19:45:52.624039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T19:45:52.695270Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.695270Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:0acceb3b211af2601f97b44136aa10a1f10e900a4319f2f651eb138d284f161a","observation_id":"255f7f21-4cc0-4c52-b8bb-4f8f972f554a","resolution":{"observed_at":"2026-08-06T19:45:52.695270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.527909Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"5b045c65-272b-4cc7-b532-6f36413dbe85","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.724114Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:983aa453adc1f9b63ea63880c464b5d399daedaa509631fa6e8cf34ca75cf155","observation_id":"907d0124-c006-4743-8192-02908b83132e","resolution":{"observed_at":"2026-08-06T19:45:53.531705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-06T19:45:52.761831Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and compre- hension in vision-language large model.arXiv preprint arXiv:2401.16420, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.761831Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:90c0293023217d327ce916b41d0c4384203d0c80bfc943738359563b221c0962","observation_id":"8fe1138b-f0b8-424d-8daf-e48f4b130349","resolution":{"observed_at":"2026-08-06T19:45:52.761831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.516420Z","title":"Dense and aligned captions (dac) promote compositional reasoning in vl models.Advances in Neural Information Processing Systems, 36:76137–76150, 2023","venue":null,"work_id":"7ad5ee94-9d2a-4266-bb4a-5e92b89fb322","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.779677Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:4bd6acf696de4ff14316c1c47da704fad530bb6ab4fe1a9752d54a1ee6710f6a","observation_id":"2870a00f-fa24-45d3-8a1f-15b453fb94fe","resolution":{"observed_at":"2026-08-06T19:45:53.520358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.504878Z","title":"Teaching structured vision & language concepts to vision & language models","venue":null,"work_id":"a9d44f79-6958-44f0-9a2b-fcb28880e5cb","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.873754Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:1eb3bc0c9ffff3978f007dcd4c367c350e01dab5cfc22a8e054a1f4d4e63bb47","observation_id":"53581e1d-5568-463a-a2ed-2a178875b130","resolution":{"observed_at":"2026-08-06T19:45:53.509035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.492434Z","title":"Dense and aligned captions (dac) promote compositional reasoning in vl models.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"41be22dc-b46c-471c-a4d5-eb45d426771a","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.904104Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:982a6f7c80a7d17059c29c297ee3337b6050b58b9ded8a2a6f308247b87f3056","observation_id":"b3cbef5f-286e-4ca8-abc8-4dc10f2b40d7","resolution":{"observed_at":"2026-08-06T19:45:53.497514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.480774Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"92bd21d1-f363-4164-a0b8-30c874056437","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.907558Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:52c075df1d6048894ddc8fbc6c08e234c48d965ae8c1e7521c5625de59bbdf53","observation_id":"ff1e9ff5-461c-410f-99de-bdf4a9bf2b57","resolution":{"observed_at":"2026-08-06T19:45:53.484864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.468654Z","title":"Advances in deep concealed scene understanding.Visual Intelligence, 1(1):16,","venue":null,"work_id":"89b73493-05ce-45d8-9cab-4b871d69a054","year":null},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.910679Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:53c54d00b02a7c0580373117a34597f283b7b9567ee478afdf9d0ab17034a7ba","observation_id":"bc526a0e-7a79-435c-b2c1-9d0b1222b699","resolution":{"observed_at":"2026-08-06T19:45:53.472951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16261","last_updated":"2024-11-07T15:35:52Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:58:20Z","title":"Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16261","snapshot_observed_at":"2026-08-06T19:45:52.913989Z","title":"Mini-internvl: A flexible-transfer pocket multimodal model with 5% parameters and 90% perfor- mance.arXiv preprint arXiv:2410.16261, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.913989Z"},"links":{"cited_paper":"/paper/2410.16261","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:e1d1343fccebd4bdb358ed79094c1c8db71d46df1ab874e675636f6ff227fbcf","observation_id":"7883666e-4ec6-4b91-a616-a090dfa88957","resolution":{"observed_at":"2026-08-06T19:45:52.913989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:52.917752Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.917752Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:820f4edc972b8f3cb2a8327694d617428efb98b4c31196e5a8ecbbb638092f22","observation_id":"ff800481-a222-45c8-80db-7d4383db1b2e","resolution":{"observed_at":"2026-08-06T19:45:52.917752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.449369Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":"1d789d86-4b62-41e4-95de-cf51e553f2c6","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.921818Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:0402aa4c6d39394fda8395a1be04dfc77704fb58451f745875eb442310f27042","observation_id":"034cbaee-71a7-48be-bae9-c85b71a30a3a","resolution":{"observed_at":"2026-08-06T19:45:53.453433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T19:45:52.925907Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.925907Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:c90579043d2b9d1efb5240eff1ad431bfd6ef93ea2199d10147ed4863e322939","observation_id":"37d2f436-fce2-4aec-9234-3c5a9aa599ab","resolution":{"observed_at":"2026-08-06T19:45:52.925907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07323","last_updated":"2025-02-11T07:42:44Z","snapshot_observed_at":"2026-08-09T12:57:37.885220Z","submitted_at":"2025-02-11T07:42:44Z","title":"Semantic to Structure: Learning Structural Representations for Infringement Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07323","snapshot_observed_at":"2026-08-06T19:45:52.929510Z","title":"Semantic to structure: Learning structural representations for infringe- ment detection.arXiv preprint arXiv:2502.07323, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.929510Z"},"links":{"cited_paper":"/paper/2502.07323","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:93ad62076e86c11b2f03bfe1501d617957701a6274ee2ef11fd13e3e67f3826e","observation_id":"784193e0-7fa7-4c41-970e-390885a53cf6","resolution":{"observed_at":"2026-08-06T19:45:52.929510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.437345Z","title":"Secret lies in color: Enhancing ai-generated images detection with color distribution anal- ysis","venue":null,"work_id":"ccb818f3-dbb4-4cab-8376-0172811795fa","year":2025},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.933305Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:cccc1500d89be00051d413ded91df35f62583eed3b605c41c50658dcc1eb4c85","observation_id":"56f713ab-86a7-4915-b5d1-57a18790bbda","resolution":{"observed_at":"2026-08-06T19:45:53.441738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:52.936493Z","title":"Elevater: A benchmark and toolkit for evaluating language-augmented visual models.Advances in Neural Information Processing Systems, 35:9287–9301,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.936493Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:bad69e31f8ffa75618584c7a847f4a559325b1d5d594d25dc3f77e4dbe7a4d8f","observation_id":"d19b3da0-5082-4a78-aa13-25f335ec430d","resolution":{"observed_at":"2026-08-06T19:45:52.936493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:52.939887Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.939887Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:c38b01b60e6214e95a772e16fdb31ea2a03489991527aa0fa4e99a5d3fb58bb2","observation_id":"3398b2d4-3be4-426a-a529-90823f509958","resolution":{"observed_at":"2026-08-06T19:45:52.939887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.411056Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"15bf248d-6c9a-4879-a965-f09a2624add0","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.943579Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:6de75ac200f3da17d94bbb77c3a93a3eba0f40962f66e3e10d1d5953988a8136","observation_id":"d0c50298-4162-40d0-a531-ad5605347184","resolution":{"observed_at":"2026-08-06T19:45:53.415920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.399882Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"ee682d98-f6f2-48f6-b76c-9d1ecfc9a26a","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.947716Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:d118685cf7df99cee5046292b6d33cad0ff0145f4ea3dec5fedb3ffd6b03fc35","observation_id":"8a3fd584-54a8-4495-8687-75df5a833d64","resolution":{"observed_at":"2026-08-06T19:45:53.403872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.388673Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":"3ae02e91-00b4-4908-b196-81384c724219","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.951149Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:f5398b418bb7cf3719013a13b9848f431edcff792483e8fbf440d0132758a723","observation_id":"e46b6ba9-fbad-431f-a29a-0b7d99b39aa6","resolution":{"observed_at":"2026-08-06T19:45:53.392740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-06T19:45:52.956170Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training.arXiv preprint arXiv:2403.09611, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.956170Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:25324c4632440fd715ee1ac1e1ade2763409f90910893f9d4f98ada85bce15dd","observation_id":"2280f4f3-b2b0-4be1-838b-7c667339728c","resolution":{"observed_at":"2026-08-06T19:45:52.956170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.377758Z","title":"Synthesize diagnose and optimize: Towards fine- grained vision-language understanding","venue":null,"work_id":"3223bcde-4899-402c-a8c3-b1267241b053","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.960323Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:7960450b0d9febe2424997b06553591f3d08f9db047a31ba1a2e3e9ee41f4ccc","observation_id":"0c1b60e1-3386-462d-a2d7-9aa857a4ddf5","resolution":{"observed_at":"2026-08-06T19:45:53.381845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T19:45:52.963677Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.963677Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:8a245b11d3cc42b9641a4997a38019a0bfc6a2765d7ee087ae1986c321491228","observation_id":"d93327d3-3d0c-4963-85bc-6477f84f3fa1","resolution":{"observed_at":"2026-08-06T19:45:52.963677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.366975Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"74e5ba46-dcda-4f62-b224-89a40860bc6f","year":2021},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.967774Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:ac522184075f538f670a55e05e401efe949eb3d99ed9684c3906c70397cdaf38","observation_id":"66df1fac-28a3-490d-ab5e-9321e882a381","resolution":{"observed_at":"2026-08-06T19:45:53.370750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T19:45:52.971449Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.971449Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:5ed3da6451802cc4e60a17a056e93234dd0e902561db8ff49a8e0603e25b5f2d","observation_id":"5f425da8-9735-4cc6-9291-eed2103a7e35","resolution":{"observed_at":"2026-08-06T19:45:52.971449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.355302Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":"b6bfa729-fba6-4c0d-8b03-d263b19ad653","year":2022},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.975175Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:1f489eb1655d0491bec3f2f8629293d0fec279bf05c4a860bc0a9d10f8796324","observation_id":"e4bcd0cc-39f7-4c3a-9b0d-7c18cb48a168","resolution":{"observed_at":"2026-08-06T19:45:53.359516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.344358Z","title":"Yfcc100m: The new data in multimedia research","venue":null,"work_id":"567dc0fd-2c36-4fd3-8ea0-ac86a4b1f738","year":2016},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.978562Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:e8e0ab8ccec3d2749db1c5bf08d6dd905b01a63ac23b17ef783b8a965d07f9ad","observation_id":"76d185f6-1d9b-4154-9f2f-b3e45f382573","resolution":{"observed_at":"2026-08-06T19:45:53.348027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.331424Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"2ef7d1d5-96bb-48e6-bbc3-efeab37150ef","year":2022},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.982108Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:91471671ebbb0d30ff64bc5637e8835faec667d1df37e06b66d023269d0dfdb9","observation_id":"82a8c44b-5adc-4a9c-babc-da6136a43e44","resolution":{"observed_at":"2026-08-06T19:45:53.336292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.318943Z","title":"A picture is worth more than 77 text tokens: Evaluating clip-style models on dense captions","venue":null,"work_id":"90666997-b31e-426c-a3e2-858fbe6984cf","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.985873Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:757bba5214e554707704359e93f1cec829f3f81a1e84f49c62e7a7d79b67c4e4","observation_id":"d6a37b8d-b988-4cf3-8ecc-a2c11124e0e8","resolution":{"observed_at":"2026-08-06T19:45:53.322934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:52.989662Z","title":"xgen-mm (blip-3): A family of open large multimodal models.arXiv preprint arXiv:2408.08872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.989662Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:529fbf1b1abcabb73cee9bc72b17d92b9dccdfae00ad2ee74c9fc094a514b604","observation_id":"eefbe169-f499-4469-9781-0b24b3d440ee","resolution":{"observed_at":"2026-08-06T19:45:52.989662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.306595Z","title":"What you see is what you read? improving text- image alignment evaluation.Advances in Neural Informa- tion Processing Systems, 36, 2024","venue":null,"work_id":"cb00dd2e-de5e-4cb5-9f0f-49fd691de47b","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.993852Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:a8605e2e5a274ec038de2bceb00d2f8baf53fdd809a1c7cb8c6e55561654a443","observation_id":"5d2c2618-0cf4-4fb8-a16d-838f722ac5b8","resolution":{"observed_at":"2026-08-06T19:45:53.311324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.294622Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? InThe Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":"059cd523-843b-4113-be67-aa2ed97d2dea","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:52.997084Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:3a929a7e517d9499440bb9d91da294aec635e77b626c22fa5e2260f3c6c03b96","observation_id":"3b220d1b-48cf-46f1-8116-12b54b6a27ea","resolution":{"observed_at":"2026-08-06T19:45:53.299125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08276","last_updated":"2022-06-01T16:45:09Z","snapshot_observed_at":"2026-08-09T00:48:25.798151Z","submitted_at":"2021-11-16T07:55:26Z","title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08276","snapshot_observed_at":"2026-08-06T19:45:53.000363Z","title":"Multi-grained vi- sion language pre-training: Aligning texts with visual con- cepts.arXiv preprint arXiv:2111.08276, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:53.000363Z"},"links":{"cited_paper":"/paper/2111.08276","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:53df115e41857ec9194d028a6e2561fb819966346b918694c450f0dedab2b77e","observation_id":"ed6d5e29-6cf9-4f0b-bf71-73cdb6b0e7d3","resolution":{"observed_at":"2026-08-06T19:45:53.000363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.282966Z","title":"Investigating compositional chal- lenges in vision-language models for visual grounding","venue":null,"work_id":"efe33915-1ae4-4fb5-8c01-2427e445976d","year":2024},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:53.003972Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:6c7de7a0ebaca4544ffe72c56965d12bad897d130f901e3808e9d542e239a8f5","observation_id":"9b14da76-f3fe-4ef7-9011-0ab3907d6449","resolution":{"observed_at":"2026-08-06T19:45:53.287164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:45:53.268414Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"26bae1bd-e5ed-4d21-8132-d4b535935127","year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:53.007487Z"},"links":{"citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:c12837e88048a885aeb4d13d5acd802703c3c3fedd7d2c50bc14e64d21f6d73e","observation_id":"6bec6939-e9bd-4efe-a87d-d4f9fac82942","resolution":{"observed_at":"2026-08-06T19:45:53.274342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-05T08:04:30.259196Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-06T19:45:53.011960Z","title":"Vl- checklist: Evaluating pre-trained vision-language models with objects, attributes and relations.arXiv preprint arXiv:2207.00221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:53.011960Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:5948dfdea17e6dc3ce94c9a5500f89a5b718ced182a9052526216d379cdcfdb9","observation_id":"b54f18df-cf1d-496b-8186-365b28cf9c0a","resolution":{"observed_at":"2026-08-06T19:45:53.011960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T19:45:53.015838Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:53.015838Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.04699"},"observation_digest":"sha256:bc35d055cd7586d9de287d2a6e85065f3b74e33c7e086ca3011b32c7a193041e","observation_id":"6faa031f-bd95-4ea0-9866-de705e61db24","resolution":{"observed_at":"2026-08-06T19:45:53.015838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04699","last_updated":"2025-07-07T06:47:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T12:57:55.488957Z","submitted_at":"2025-07-07T06:47:10Z","title":"A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2507.04699."}