{"as_of":"2026-08-10T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed5aacc47451c1ae39ac32e277b515fb66de7dafc41b945c299cc817c6384019","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:32:48.742052Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08000/citation-record","integrity":"/paper/2507.08000/integrity","json":"/paper/2507.08000/citation-record.json","paper":"/paper/2507.08000"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.342357Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"84f75a10-d146-43d3-b221-a454760569fd","year":2021},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.404148Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:fdb2e0f0c66a51a8a14f456c612ae350a5812a43c679813999a7612e3ee14989","observation_id":"b196439a-1861-4339-b27d-57c23a0700be","resolution":{"observed_at":"2026-08-06T18:32:52.403863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:44.526529Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.526529Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:625fba887902eebff111660e4a44ea814adaf65626959964bdf620499e162b2f","observation_id":"c88cb4d2-17f0-4076-a45d-90484707a1c3","resolution":{"observed_at":"2026-08-06T18:32:44.526529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:32:44.629556Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.629556Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:313793448cd65c5d2fb10fc6920ec5b441126c63196bb670055808ad53ee4ed1","observation_id":"c011eae3-7836-4a3b-b2ea-870a6c0caea6","resolution":{"observed_at":"2026-08-06T18:32:44.629556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.191634Z","title":"Visualinstructiontuning","venue":null,"work_id":"533ea222-20ee-48f9-8765-355204df1029","year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.743931Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:909a5d503ec9a6c1faeb792b6294383850b8a2924f68bea8c60b99027bca60c8","observation_id":"0a4e9da3-a4ec-46ae-bc55-b4275ba7210d","resolution":{"observed_at":"2026-08-06T18:32:52.252715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T18:32:44.845309Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.845309Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:003b717473ff31e642c611110a781dc537c316960c65a427595569345081ae76","observation_id":"c41c3b77-5c8b-437a-9899-718f0553e9b6","resolution":{"observed_at":"2026-08-06T18:32:44.845309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-06T18:32:44.933692Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:44.933692Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:23e7b2a0891d288b7f4b39cd6d098d9cfb00c5c3d89d3a3c9bddd716600e090b","observation_id":"40584af3-8ba4-42ac-aa75-446cec0fdab3","resolution":{"observed_at":"2026-08-06T18:32:44.933692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00644","last_updated":"2020-09-14T09:55:13Z","snapshot_observed_at":"2026-08-02T01:40:39.854832Z","submitted_at":"2020-07-01T17:53:26Z","title":"Measuring Robustness to Natural Distribution Shifts in Image Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00644","snapshot_observed_at":"2026-08-06T18:32:45.071477Z","title":"Measuring robustness to natural distribution shifts in image classification.arXiv preprint arXiv:2007.00644, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.071477Z"},"links":{"cited_paper":"/paper/2007.00644","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:c263eb007874369af139a7a1bdaa119337fc1ed4e4c4601499c83d5446ab1d60","observation_id":"83d88bc5-375e-4231-84ed-706503d94dec","resolution":{"observed_at":"2026-08-06T18:32:45.071477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16241","last_updated":"2021-07-24T04:28:58Z","snapshot_observed_at":"2026-07-06T09:33:44.070039Z","submitted_at":"2020-06-29T17:59:10Z","title":"The Many Faces of Robustness: A Critical Analysis of Out-of-Distribution Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16241","snapshot_observed_at":"2026-08-06T18:32:45.197907Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.197907Z"},"links":{"cited_paper":"/paper/2006.16241","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:bd825b9d8b2063fac21746c93e79701a19bac564f8def62f2f9ccf1d3f3662b7","observation_id":"cdeac91e-f2f1-46a2-b25d-d012f3d9d14f","resolution":{"observed_at":"2026-08-06T18:32:45.197907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.163199Z","title":"Objectnet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","venue":null,"work_id":"5bd9a0c1-415c-42d4-915d-3440190d6da4","year":2019},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.324151Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:1bf8683337638633122413fe5a995ef1b768a3a7fddf5d5e8abab5f733a93c01","observation_id":"9b5d6ad1-921b-4dcc-8427-8a7f921c63ca","resolution":{"observed_at":"2026-08-06T18:32:52.174976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:52.008924Z","title":"Data determines distributional robustness in contrastive language image pre-training (clip)","venue":null,"work_id":"14708a5b-7e23-42b5-95e7-26436e3fd1d7","year":2022},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.443919Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:4ec5ea0b02964175971c4845d3c20c2bcade1369f27140b10c3fcb22cb6f5167","observation_id":"1e89ab05-e4e0-417c-a567-7af021e4aec6","resolution":{"observed_at":"2026-08-06T18:32:52.066083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.885403Z","title":"The neglected tails in vision-language models","venue":null,"work_id":"15afe2d0-2d48-49e5-8895-e9a57d2c5c86","year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.583592Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:6a2d93ea96833a241362a7dd971e625ac6db8d57b669a8213d84b1d2d9a844fe","observation_id":"6e24f533-29e8-4405-80ef-4b3ca13b1423","resolution":{"observed_at":"2026-08-06T18:32:51.945896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.750235Z","title":"zero-shot","venue":null,"work_id":"13e12f82-4381-46d8-bc48-3592c8bfa7c1","year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.659673Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:3ea1423c2945ce9f8004f3c1638bd25630d3a805ebe6abadffe478154530f2ab","observation_id":"98585498-f97c-4134-b086-41f08b14aaf2","resolution":{"observed_at":"2026-08-06T18:32:51.840210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18326","last_updated":"2025-02-17T16:52:02Z","snapshot_observed_at":"2026-08-07T18:11:44.825960Z","submitted_at":"2025-02-17T16:52:02Z","title":"Pretraining Frequency Predicts Compositional Generalization of CLIP on Real-World Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18326","snapshot_observed_at":"2026-08-06T18:32:45.745787Z","title":"Pretraining frequency predicts compositional generalization of clip on real-world tasks.arXiv preprint arXiv:2502.18326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.745787Z"},"links":{"cited_paper":"/paper/2502.18326","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:8f746509212ddbd416570983312700d8f49bed0ce3bbc0fbd8401eae50017ed8","observation_id":"4ee03997-7c78-4265-b26f-1a83e7a71c79","resolution":{"observed_at":"2026-08-06T18:32:45.745787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.601360Z","title":"Deciphering the role of representation disentanglement: Investigating compositional generalization in clip models","venue":null,"work_id":"166a8094-005b-445c-91a9-6a82422a91a6","year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.842927Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:ec5879153f2b605173939c00b77d35020291d67be2e02af5d00e0047cebe1eb5","observation_id":"fd56ea5e-25a5-4d91-9f4c-6d6187645e1b","resolution":{"observed_at":"2026-08-06T18:32:51.676249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:45.923104Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:45.923104Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:e70b8c7d488b89b8d67456886540826eb573acd49b080ea130c3a45e89c97c47","observation_id":"25838902-9322-43f2-ba82-ce2c655a5bce","resolution":{"observed_at":"2026-08-06T18:32:45.923104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:46.096827Z","title":"@ crepe: Can vision-language foundation models reason compositionally?2023 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 10910–10921, 2022","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.096827Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:a691df848a45a4ee662817b001e9251997386b4a0d70c625c10e73a1639d0444","observation_id":"6f1add8e-df0b-4439-932e-52027ab2d4e3","resolution":{"observed_at":"2026-08-06T18:32:46.096827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.476681Z","title":"Sugar- crepe: Fixing hackable benchmarks for vision-language compositionality.Advances in neural information processing systems, 36:31096–31116, 2023","venue":null,"work_id":"31a420b0-c3d2-4ce0-ac11-79e1cb20e9e6","year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.233303Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:63eacd24ccc56478f636cd3fcd114a4a60f522595db1dc760d754dc8be0e9958","observation_id":"207f01f4-20ed-485a-81b0-a50c81a42ec9","resolution":{"observed_at":"2026-08-06T18:32:51.545135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11497","last_updated":"2024-11-02T04:58:15Z","snapshot_observed_at":"2026-08-04T23:23:42.517974Z","submitted_at":"2024-03-18T06:04:02Z","title":"A Sober Look at the Robustness of CLIPs to Spurious Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11497","snapshot_observed_at":"2026-08-06T18:32:46.319612Z","title":"A sober look at the robustness of clips to spurious features.arXiv preprint arXiv:2403.11497, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.319612Z"},"links":{"cited_paper":"/paper/2403.11497","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:4244a169032d80beca0db27ed2760815c66077ecf963f22f753eeae262bd8f1a","observation_id":"60d29984-4d5e-4197-be41-e06da54d3ebe","resolution":{"observed_at":"2026-08-06T18:32:46.319612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.338121Z","title":"Word association norms, mutual information, and lexicography","venue":null,"work_id":"e8cb2db6-1ae1-4ca1-9bdf-1a98e220a25c","year":1990},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.419843Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:390fbf54d8b5acd75231fb0d627ffd8e1741e1d5c7e234a1eca9da57fb39727a","observation_id":"ba669502-0b95-4bcf-994b-d60523b9e356","resolution":{"observed_at":"2026-08-06T18:32:51.407432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:46.490093Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.490093Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:270cdaeea9ddfd54bc6566664034b4c9123e86b43db57c99164e6a275b338ea1","observation_id":"28885a78-4344-42a2-8dc0-c171b6de1729","resolution":{"observed_at":"2026-08-06T18:32:46.490093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T18:32:46.563950Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs.arXiv preprint arXiv:2111.02114, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.563950Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:52c4c9e0bd35f91a47801950af93061b583095f6268b3d5c5cbb58120732f3b2","observation_id":"f16bf04a-f7e2-4076-9a3b-7985e3121b76","resolution":{"observed_at":"2026-08-06T18:32:46.563950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.173687Z","title":"Two multivariate generalizations of pointwise mutual information","venue":null,"work_id":"db3e4298-c5e3-4f40-b775-a5d03caeed0a","year":2011},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.701812Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:46d5a8ca3ff4d6182f7c6510500d74d8d117649e0d2cbe852708c7b94cfb6ad0","observation_id":"b72d4b65-5d59-420b-a6f5-e07168d0e385","resolution":{"observed_at":"2026-08-06T18:32:51.247942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:51.035405Z","title":"Lawrence Zitnick, Devi Parikh, and Dhruv Batra","venue":null,"work_id":"bebc31d4-3637-4562-86ba-55a208d83af5","year":2015},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.817205Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:823b3f2d1f84602dc09b6cf3e2335241d47b57503144473792a2fc7e5cd005da","observation_id":"1dd04bef-0152-489f-bd1f-a6b49fee3bc1","resolution":{"observed_at":"2026-08-06T18:32:51.128937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:32:46.919345Z","title":"Thellama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:46.919345Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:7170cbd322cbe2ad53244b5436bfad1813ecbe15eddf39e683efe6cfb2f36e0b","observation_id":"2121567b-7e69-49a4-bde3-1243b2b32d97","resolution":{"observed_at":"2026-08-06T18:32:46.919345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:47.040675Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.040675Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:0c56050a5529bec4ed8e975a625d9cd3dc56876b6e0410642bf5b9ddfcd6ff21","observation_id":"2ca3ebd8-02d4-4d88-aed2-02bb93b9094d","resolution":{"observed_at":"2026-08-06T18:32:47.040675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T18:32:47.160787Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.160787Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:c6011a2adb10d8fd3699a36f5de04c5c22a4fbba82bc8d9765911d20e9989327","observation_id":"29bd6e86-cc0b-483e-b38c-3a47cc355b84","resolution":{"observed_at":"2026-08-06T18:32:47.160787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:47.262926Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.262926Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:536a9843eaf0e4544054efc1de015fe64b2ed68159e9e959572cb71e261ef59d","observation_id":"250aebb7-906b-4c67-9cf9-ee4314c75f4f","resolution":{"observed_at":"2026-08-06T18:32:47.262926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:50.979662Z","title":"Towards vqa models that can read","venue":null,"work_id":"a389fe40-0a46-4303-8736-e97fb10f7d2e","year":2019},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.314389Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:696c5ce0db39543f82cdb06265a673af4730abf3a6f4d1db55698b8d1f034551","observation_id":"339cc28c-f88e-461b-a376-9e1d25dc31cc","resolution":{"observed_at":"2026-08-06T18:32:50.999667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:50.673841Z","title":"Recognition in terra incognita","venue":null,"work_id":"781a72df-a854-47e9-92b6-cced6a1a5f96","year":2018},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.418010Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:d74ae676fc5f32dfabb26ab9b1e282aef96784863d424fd91a635bbcc1a66e34","observation_id":"09724e1e-11fb-4555-88d7-7bb5ee6c3fcb","resolution":{"observed_at":"2026-08-06T18:32:50.800409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:50.333279Z","title":"Variable generalization performance of a deep learning model to detect pneumonia in chest radiographs: a cross-sectional study.PLoS medicine, 15(11):e1002683, 2018","venue":null,"work_id":"cd05a4c8-f05d-49b4-8e58-04fbf1441205","year":2018},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.520665Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:64253b465e2b058c5eff73ea718e1197a60f28537155ff2629a6816e53b2028f","observation_id":"266d094f-4272-4fc4-ad49-9c6785ed3322","resolution":{"observed_at":"2026-08-06T18:32:50.443100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:47.603989Z","title":"Hashimoto, and Percy Liang","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.603989Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:410d4531b4dc3a33cdca3ba2a95eda0a7073f7864c1b77e486d90486f20b613e","observation_id":"47a9c4c8-3021-4671-9691-255ae3e0b563","resolution":{"observed_at":"2026-08-06T18:32:47.603989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:50.042587Z","title":"Shortcut learning in deep neural networks.Nature Machine Intelligence, 2020","venue":null,"work_id":"b3e76575-a388-4fa3-a659-d77842476d88","year":2020},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.674980Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:daab8de4ac3e4f8a905ff027d877d43a0a420a97ef4a382a640382536f23a437","observation_id":"3eb9b301-b9c7-4258-9f7d-2ec1efb4b97e","resolution":{"observed_at":"2026-08-06T18:32:50.185552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:49.772692Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"88705367-6aaa-45a3-9857-4c383654fd2a","year":2017},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.791137Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:3779883e652bd0185df2b81260699e1be0b0d758e567f432cba44518a63bf091","observation_id":"cd90cc6b-1161-4104-862c-38303358836a","resolution":{"observed_at":"2026-08-06T18:32:49.863554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10613","last_updated":"2021-09-22T09:25:41Z","snapshot_observed_at":"2026-07-30T23:36:30.900578Z","submitted_at":"2021-09-22T09:25:41Z","title":"COVR: A test-bed for Visually Grounded Compositional Generalization with real images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10613","snapshot_observed_at":"2026-08-06T18:32:47.888275Z","title":"Covr: A test-bed for visually grounded compositional generalization with real images.arXiv preprint arXiv:2109.10613, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:47.888275Z"},"links":{"cited_paper":"/paper/2109.10613","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:11c61f53e7210a95b3d35be20653d361fe8dd0a6d3647c03646233e854fe122b","observation_id":"a353761a-8675-4775-ba49-8e40afb2a124","resolution":{"observed_at":"2026-08-06T18:32:47.888275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10537","last_updated":"2024-08-30T04:51:28Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:46:28Z","title":"Does CLIP Bind Concepts? Probing Compositionality in Large Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10537","snapshot_observed_at":"2026-08-06T18:32:48.029297Z","title":"Does clip bind concepts? probing compositionality in large image models.arXiv preprint arXiv:2212.10537, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.029297Z"},"links":{"cited_paper":"/paper/2212.10537","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:1d0e21eed9fe7f7732b23864d9e36fe4d041166014f6a86b923e6e31c50170c5","observation_id":"cddf270b-ab97-4fbf-939b-36699f877d03","resolution":{"observed_at":"2026-08-06T18:32:48.029297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-03T09:40:32.201832Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-06T18:32:48.147656Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?arXiv preprint arXiv:2210.01936, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.147656Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:ddded60da81eab83b624ee883660350ada4e7a3752a5274356c715cb1f53f216","observation_id":"e72a3b76-2f3c-414e-b73d-298ca1be321a","resolution":{"observed_at":"2026-08-06T18:32:48.147656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.223641Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.223641Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:a5b0290614eaa0a74e6839227d65c8a7abdb91af315127b8946d64d8328f08d6","observation_id":"9cc3661c-57d7-4361-ab1d-fe160a633f48","resolution":{"observed_at":"2026-08-06T18:32:48.223641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.297322Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.Advances in Neural Information Processing Systems, 37:87310–87356, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.297322Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:fe09f51c8678c4ac1b41ced64c11e1d7d6ae17c08178dc8bddd1bb19034927c5","observation_id":"c98760e6-266c-46ff-82b8-da61dc20f370","resolution":{"observed_at":"2026-08-06T18:32:48.297322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.326309Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.326309Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:84c3a63c3f3763cc7f064f4a72f7334b8f9f31addbeb0e34482c7edcb68fbf8a","observation_id":"8b821a8e-93e2-45bc-a01f-1e1abb7fc48b","resolution":{"observed_at":"2026-08-06T18:32:48.326309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09733","last_updated":"2024-10-13T05:35:09Z","snapshot_observed_at":"2026-08-02T08:33:00.410905Z","submitted_at":"2024-10-13T05:35:09Z","title":"MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09733","snapshot_observed_at":"2026-08-06T18:32:48.390311Z","title":"Mmcomposition: Revisiting the compositionality of pre-trained vision-language models.arXiv preprint arXiv:2410.09733, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.390311Z"},"links":{"cited_paper":"/paper/2410.09733","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:f74465fa2814048be1fa1d3559d86415005c78dd57f15b35aaf51bfc1d7c84dc","observation_id":"08c3f604-a780-46fe-b6b7-cb5b067c7cd4","resolution":{"observed_at":"2026-08-06T18:32:48.390311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:48.461452Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.461452Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:ee6351855164bbc8c884a541c81efadfaf1483e0d676d65cb0a2821e69b7305c","observation_id":"353242e8-6191-4d6f-b25c-f2d98f403f79","resolution":{"observed_at":"2026-08-06T18:32:48.461452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:49.610794Z","title":"Segment anything","venue":null,"work_id":"e176942e-0c26-466a-a53a-a15271180529","year":2023},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.536131Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:4a8ae4d4272369362f62bf8b4facbde275468c4bdd186256e4d5eb4d36219dde","observation_id":"63fcb153-04db-4f4e-a61f-25e58fd4085f","resolution":{"observed_at":"2026-08-06T18:32:49.683465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01903","last_updated":"2022-06-21T21:50:28Z","snapshot_observed_at":"2026-07-06T11:44:19.030296Z","submitted_at":"2021-09-04T17:11:28Z","title":"Robust fine-tuning of zero-shot models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01903","snapshot_observed_at":"2026-08-06T18:32:48.612236Z","title":"Robust fine-tuning of zero-shot models.arXiv preprint arXiv:2109.01903, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.612236Z"},"links":{"cited_paper":"/paper/2109.01903","citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:15596b5803ef0f902e38cae74d2d8bdcf22c8793e4a1638f443db0ce7893fec6","observation_id":"0293cf60-53c7-4324-bdb7-91f2a2f60ea7","resolution":{"observed_at":"2026-08-06T18:32:48.612236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:49.462444Z","title":"Openclip, July 2021","venue":null,"work_id":"152a9406-7c2c-4bdf-964e-a71af071dcd9","year":2021},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.687684Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:fbfacf731c7e4972156a40466ad658020dec2f4ddc10333699d7d2a57258be13","observation_id":"9adf4580-b315-4ca6-9b5c-3bc902cd207a","resolution":{"observed_at":"2026-08-06T18:32:49.533161Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:32:49.326194Z","title":"visualizable","venue":null,"work_id":"8813f9af-6d0e-45f9-96e1-3a8807b52bcf","year":2009},"citing_paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.742052Z"},"links":{"citing_paper":"/paper/2507.08000"},"observation_digest":"sha256:b2e6381d3d76535385b301fd73292165fde29020d20b580f69dcf5ecb095778b","observation_id":"2026a014-5c8c-4b95-bae7-1d3c8799e045","resolution":{"observed_at":"2026-08-06T18:32:49.387084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08000","last_updated":"2025-07-10T17:59:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:55:05.081511Z","submitted_at":"2025-07-10T17:59:59Z","title":"Impact of Pretraining Word Co-occurrence on Compositional Generalization in Multimodal Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2507.08000."}