{"as_of":"2026-08-08T13:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34f9f4347cae229e6dc6d2ec59494de2e2cfcc4f857b3e43b3b1357c270299e1","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:05:42.456961Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T03:55:55.359488Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T03:56:21.523747Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"cited_work":{"arxiv_id":"2505.20021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ef9edf1d-c0bc-4548-9982-839caebe542a","year":2025},"citing_paper":{"arxiv_id":"2605.10761","last_updated":"2026-05-11T15:57:35Z","snapshot_observed_at":"2026-08-02T12:12:15.627459Z","submitted_at":"2026-05-11T15:57:35Z","title":"RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T03:55:55.359488Z"},"links":{"cited_paper":"/paper/2505.20021","citing_paper":"/paper/2605.10761"},"observation_digest":"sha256:31b0d5351e5bd1d35cdb7407000245a10d0e12dc04004c5aa19b6bd412539553","observation_id":"de076bad-79c7-4850-81b7-5e0ffc96fdbe","resolution":{"observed_at":"2026-05-12T03:56:21.525579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20021/citation-record","integrity":"/paper/2505.20021/integrity","json":"/paper/2505.20021/citation-record.json","paper":"/paper/2505.20021"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T14:05:34.222869Z","title":"Abdin, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:34.222869Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:2643002c1cfbffb8873b15d6e430dbcfd2c085a40773162ed84cf47d8c61dd0c","observation_id":"795b52be-22ff-4369-977e-1c8890156936","resolution":{"observed_at":"2026-08-07T14:05:34.222869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:34.332475Z","title":"Allen-Zhu and Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:34.332475Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:3e2908dcaa46cd81be791f1a2ee5bf24bc090222424a05957b0d47dc88823ae8","observation_id":"20e25e54-91e2-4695-8a64-5e24b4b2a1c0","resolution":{"observed_at":"2026-08-07T14:05:34.332475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:34.421047Z","title":"Antol, A","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:34.421047Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:e2b0f9e0669bb2ec9a45b4384c97473aff4d144bfab810a53d9472a03b111c95","observation_id":"0e44503a-5e38-46b2-8b14-a4a40bfdd685","resolution":{"observed_at":"2026-08-07T14:05:34.421047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15936","last_updated":"2023-11-06T00:36:24Z","snapshot_observed_at":"2026-07-06T16:00:08.643627Z","submitted_at":"2023-07-29T09:22:54Z","title":"A Theory for Emergence of Complex Skills in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15936","snapshot_observed_at":"2026-08-07T14:05:34.543572Z","title":"Arora and A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:34.543572Z"},"links":{"cited_paper":"/paper/2307.15936","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:c0921d6e4a621e73fa084f8388469df19ec603bccb277e2a7844d6506ded0513","observation_id":"f6967756-261e-48d4-aa1a-a52a0175bce6","resolution":{"observed_at":"2026-08-07T14:05:34.543572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T14:05:34.683309Z","title":"Austin, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:34.683309Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:8f740da2fe4e418d4f900c0038968f0f4e1a5cbbee4a7cd93c25156e05a88ff9","observation_id":"b068dc6d-adea-42e7-bc0c-efda2aa181ac","resolution":{"observed_at":"2026-08-07T14:05:34.683309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:05:34.765882Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:34.765882Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:4d0140b1a9640b7f401e5cc5b6f2430129093691f8c4c593431d1b06b0517de2","observation_id":"7ce5cc7b-d201-482d-8b99-9a2247b4a6b9","resolution":{"observed_at":"2026-08-07T14:05:34.765882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:34.894746Z","title":"a is b\" fail to learn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:34.894746Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:a29d5b7e414c8d9d924da19435511c94a115fe32f4250c6a82eb61bf188efd6e","observation_id":"7c3df1fe-2758-4fd3-82fb-bf47cc7da3e1","resolution":{"observed_at":"2026-08-07T14:05:34.894746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-07T14:05:35.000146Z","title":"Bordes, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:35.000146Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:15132a1cef779bc1c686599a8498de7355c3468a66c77629f890c240b386113d","observation_id":"e4d8c62c-0d45-4f12-9cc8-0161ea0c5337","resolution":{"observed_at":"2026-08-07T14:05:35.000146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:35.094711Z","title":null,"venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:35.094711Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:e74cf3b01e22f368724b4373a6442a755039edddd94042f5551545fdcbe1bdbe","observation_id":"358c7624-7bda-4f12-b4ff-8efa597a0b1c","resolution":{"observed_at":"2026-08-07T14:05:35.094711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:35.228731Z","title":"Cao and J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:35.228731Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:940855a1d649ef25d2f17b572aafb091beb068663a028b1daef908322b7e3309","observation_id":"d9a4eaaa-ecae-4eec-9c81-bdc2cc603662","resolution":{"observed_at":"2026-08-07T14:05:35.228731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:55.995697Z","title":null,"venue":null,"work_id":"78fd66be-668f-4e54-82d3-87a56cacd37b","year":2022},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:35.328449Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:2beccbfe26a756b2a2c319c3a3cef7731cf4834a9a0d03efed6f42668bce97b8","observation_id":"2e0cf66b-54e6-4532-ac01-a8a0e44b1e57","resolution":{"observed_at":"2026-08-07T14:05:56.048996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:55.847279Z","title":null,"venue":null,"work_id":"247e34ae-72e8-4bcb-b8d2-8189ed00d5bc","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:35.427288Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:44e53dac1bbb17b1580127a2dfbc225445047d80069cbb9a0fbe857e11bd93a3","observation_id":"59fa14f8-f2cd-4313-bfce-dde95930057e","resolution":{"observed_at":"2026-08-07T14:05:55.924448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:55.723989Z","title":"Deepmind","venue":null,"work_id":"4536838a-8df7-4499-99a4-f161a5f8b6ed","year":2025},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:35.514643Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:b78d0ac321ff5ee0ff3dc6cca56f3f92721a0907e1948180406e3a9c010477b8","observation_id":"9414f5fd-52de-4cdc-919e-3f73b080c0bc","resolution":{"observed_at":"2026-08-07T14:05:55.777345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:55.566137Z","title":"Deepmind","venue":null,"work_id":"b805089a-1dc9-4720-8039-8dfd837c2e13","year":2025},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:35.613946Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:3f94781a1a8a58d7f5a46732c6c8a67a940130c34e098db0d247f64779fe948b","observation_id":"4aff6f04-589c-4557-ad9c-2e3f57ba0d9f","resolution":{"observed_at":"2026-08-07T14:05:55.637881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:55.437856Z","title":"Dhariwal and A","venue":null,"work_id":"1833e43f-47cd-4f82-8c7c-78c425c3da73","year":2021},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:35.736149Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:23c1d09209fe1b8e46ed81132c5cc4fc805908a011f2ee1a44243fed48eb8da8","observation_id":"a2ab2c41-9595-48bf-a4e9-1f93b9b59d85","resolution":{"observed_at":"2026-08-07T14:05:55.516045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:55.303625Z","title":null,"venue":null,"work_id":"31ec08d3-f58b-4a57-8b2b-8580ac48f40f","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:35.838571Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:78e0204fc991df4acd05c04c9ff4b27ede5aca0a270b66b312f287a2b4d1b866","observation_id":"f4514c5e-b950-43a9-9500-e2f9b5c10df6","resolution":{"observed_at":"2026-08-07T14:05:55.386058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:55.206367Z","title":null,"venue":null,"work_id":"dc06b197-2918-47de-bcdc-c59cb16c67eb","year":2025},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:35.971460Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:5f45a189ffbb0fac454f281bc6ee08232a6ee92a5dc1edbf333d2bef2b7119ec","observation_id":"c686a3c9-81fd-472a-ab70-28b50d05b991","resolution":{"observed_at":"2026-08-07T14:05:55.249246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:55.099531Z","title":"Golovneva, Z","venue":null,"work_id":"74186d4d-cfba-4332-bb87-84f76b42535f","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.084307Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:682ec38658f7856d85b237cd4c61251af57c3472380f72d60dd4d4edd42c7d4a","observation_id":"44fd03b3-e36e-4eee-ac02-9422185d368d","resolution":{"observed_at":"2026-08-07T14:05:55.150396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:54.989744Z","title":"Goyal, T","venue":null,"work_id":"26236975-e397-4999-9aeb-61058c378784","year":2017},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.180142Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:b3d2af00347ba1e091b854e7898776f78346caa3179377ce56b40814a249fe2f","observation_id":"771fd9a2-4ae4-4175-a099-99d78da84ebd","resolution":{"observed_at":"2026-08-07T14:05:55.049173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T14:05:36.273148Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.273148Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:9f7be60bffd6676550ef524e12908ab40efe7fd58424c2df81b5dce0d81a1540","observation_id":"090f2275-d5ed-4061-938b-6d95e84a3065","resolution":{"observed_at":"2026-08-07T14:05:36.273148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:54.814714Z","title":"Gurari, Q","venue":null,"work_id":"9df6e4c8-ba99-4175-8e88-f95e394a8dc9","year":2018},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.371175Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:66950906cf5750387347f5396361634186a92ee4ecddf7fa3519e887f45177fc","observation_id":"83f3ec76-d058-42c8-89f3-3a5d7f9e5569","resolution":{"observed_at":"2026-08-07T14:05:54.907590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:54.678995Z","title":"Hanna, O","venue":null,"work_id":"edba04d0-3f9f-4430-8a0e-32d9e8f36cc8","year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.441104Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:3610993c949045cbd563271925944d4679d8da3441dd2210c0113bc5fd8f9063","observation_id":"36a57854-9c54-4459-ab07-f40317530ed0","resolution":{"observed_at":"2026-08-07T14:05:54.739548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:54.519644Z","title":null,"venue":null,"work_id":"507a3bae-f2b5-4d28-8483-a0f6915bb84c","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.494586Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:e35a5619a8457997d47618016a534dd58230d57178085a1da3d7e9c3cfdb55aa","observation_id":"cf492c02-6a9a-4966-bdee-f851caa8fa55","resolution":{"observed_at":"2026-08-07T14:05:54.594042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:54.407286Z","title":null,"venue":null,"work_id":"bd3671c1-8395-4d8c-a933-90fba80c22ed","year":2020},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.570584Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:2365f4c834c8c7ca645d366e16e242515188f405549b27ca64fca1e09e1eb4a7","observation_id":"124dd037-4006-459e-b9e1-439b2e4db9c4","resolution":{"observed_at":"2026-08-07T14:05:54.451057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14610","last_updated":"2023-06-26T11:35:22Z","snapshot_observed_at":"2026-07-06T15:46:43.973833Z","submitted_at":"2023-06-26T11:35:22Z","title":"SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14610","snapshot_observed_at":"2026-08-07T14:05:36.645985Z","title":"Hsieh, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.645985Z"},"links":{"cited_paper":"/paper/2306.14610","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:3ea76681b0a3657e73e614dc55f58dc043a6a2cdec57197da824b8f4a59ac586","observation_id":"cfc3f413-2d1c-4967-bc9a-32acf0820737","resolution":{"observed_at":"2026-08-07T14:05:36.645985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:54.267268Z","title":null,"venue":null,"work_id":"fc5435d5-e41e-4328-8d0e-8b233727732c","year":2022},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.698623Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:c60cb5274ce7ecbf96c6a167c867c2afe9917122028aae20ee7bb452ff47a205","observation_id":"696adc68-3b63-4f9d-9c0b-51f8143a11d2","resolution":{"observed_at":"2026-08-07T14:05:54.340760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:54.138744Z","title":"Flux.1-dev controlnet","venue":null,"work_id":"6527c597-f216-4492-b08e-ab70b9a42658","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.757449Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:d387b5fa0cb897dc0d88cdad81980b4b4bd728b6d1d42ac2864e58a5a5c56ff8","observation_id":"587a6e81-e059-4432-897b-6d3f0cf90c41","resolution":{"observed_at":"2026-08-07T14:05:54.191439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:54.019102Z","title":"Kafle, B","venue":null,"work_id":"1a93f779-db6d-498d-b6ed-88897cc3ddbc","year":2018},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.827681Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:78dec020ca2b73a806cc6b550a68bf33efab4a426bcf6c6d06d68f31c21da977","observation_id":"813e62f5-8e22-4500-82ab-62a7fe7de83b","resolution":{"observed_at":"2026-08-07T14:05:54.083349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:53.874004Z","title":"Kazemi, H","venue":null,"work_id":"dbcaac1b-bb20-483a-9ec6-32dc59f3951d","year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.871244Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:473aa1cb97acb752822bdadc195678b4ce319fc983cca8d37d3bf22693bdbb00","observation_id":"d3140256-ee1d-42e4-acca-471c1fca0a04","resolution":{"observed_at":"2026-08-07T14:05:53.949724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.07396","last_updated":"2016-03-24T00:02:58Z","snapshot_observed_at":"2026-08-07T19:22:55.853637Z","submitted_at":"2016-03-24T00:02:58Z","title":"A Diagram Is Worth A Dozen Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.07396","snapshot_observed_at":"2026-08-07T14:05:36.949501Z","title":"Kembhavi, M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:36.949501Z"},"links":{"cited_paper":"/paper/1603.07396","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:24bfc99655def09c3125180e780b17f62c83b2ca0286fcfdf77ccfdcdd848668","observation_id":"e7743a40-1715-4e6f-8623-38fd92585201","resolution":{"observed_at":"2026-08-07T14:05:36.949501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:53.717621Z","title":"Kojima, S","venue":null,"work_id":"513482a5-2182-4987-94a1-ab46a2918f90","year":2022},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.022596Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:7a70ccadc7a66dd49737f686b414f32f3fede433d4b75e7c8affa385f75bffc2","observation_id":"6a2d6922-ece0-4ec8-99d7-e2b87899456a","resolution":{"observed_at":"2026-08-07T14:05:53.814841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:37.136608Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.136608Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:839ab4cc93de62378671ae0dd01a77fc5e4a48e0805b1ca53fd138ea12d2066e","observation_id":"e347c95b-fe01-422a-b23a-48049d7a9bc5","resolution":{"observed_at":"2026-08-07T14:05:37.136608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:53.548726Z","title":"Lake and M","venue":null,"work_id":"d379b703-16ae-4998-9d1d-c7449c4dc84b","year":2018},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.202288Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:d57bd4e49ea97532c4e43b5975d02c55b3e32128f2c26576ea14b3836206ed35","observation_id":"e0eed4e1-8c0c-4a80-b808-7dc16247024b","resolution":{"observed_at":"2026-08-07T14:05:53.598176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:53.365080Z","title":null,"venue":null,"work_id":"b1b06316-8775-47be-af73-0e82020bc75f","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.253468Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:aa3aa7383737b2723e076e02b31b8d2a17b442b1bc6728f1897d3e33e3cc5add","observation_id":"0334fa58-7991-461e-bbdc-c934078dfe2c","resolution":{"observed_at":"2026-08-07T14:05:53.451969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:53.084790Z","title":"Lewis, N","venue":null,"work_id":"24db5c31-e261-41d9-8805-f4d8ceb5c24c","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.329177Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:ef0e7f8920a728cc21bfe420b586eb19674014ae735c433cefff78eac008778b","observation_id":"e7838624-6517-46a8-845c-793c97f1435d","resolution":{"observed_at":"2026-08-07T14:05:53.198326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:52.826563Z","title":null,"venue":null,"work_id":"d742cc64-b7af-470b-8d72-cfcc018f00b7","year":2025},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.431121Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:761b2a09332687fd2c1ee21b0123083397e2a7d4559098ecb1876d872fc3ebb2","observation_id":"50c00425-cdb2-4659-92ac-8812ce71a223","resolution":{"observed_at":"2026-08-07T14:05:52.938778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01879","last_updated":"2024-05-15T07:15:05Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T19:19:43Z","title":"Revisiting the Role of Language Priors in Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01879","snapshot_observed_at":"2026-08-07T14:05:37.515954Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.515954Z"},"links":{"cited_paper":"/paper/2306.01879","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:436f4b7b3437396a8d31513686f11033aed22a70117dcd0d8693696de43ba01c","observation_id":"04b7d7ec-d4f9-402a-ae47-7cdbe860d0e6","resolution":{"observed_at":"2026-08-07T14:05:37.515954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:52.583169Z","title":"Lin and K","venue":null,"work_id":"78a076d3-38d0-4e06-ae7a-d67043fa2dd8","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.558439Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:f3878b6e17822ecb8e76fcc9015d19ec0056afb77ff67b3cf7e1b2730948e285","observation_id":"9bf7053a-96e9-4a40-8c19-89b15847866d","resolution":{"observed_at":"2026-08-07T14:05:52.686973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:52.321411Z","title":null,"venue":null,"work_id":"42970cf2-0871-4741-a749-2e847dd9b28e","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.664224Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:5de99bb3afda04b266ab985da58708e3dccb01b32404acd473f1b58513c57c97","observation_id":"527e31b1-f555-4f39-92fc-33db36e646ac","resolution":{"observed_at":"2026-08-07T14:05:52.440764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:52.025779Z","title":null,"venue":null,"work_id":"60754fe5-e5f3-45fa-89ad-a1bc5698f0b6","year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.764682Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:02e447269c8c1b5dae94ac6c3e1bb3544f991f62dc08d068f4421ddab1500271","observation_id":"27469fce-a8e7-4d8b-9c1b-fa5029723cd0","resolution":{"observed_at":"2026-08-07T14:05:52.177661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:51.712719Z","title":null,"venue":null,"work_id":"a26aa109-0ea2-49c0-b611-fe8b86f2e692","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.845651Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:86864344bf8628095c78ef8e295862fca19c5775b1c761bd635d3e4031da0432","observation_id":"26e7c2ca-2100-4312-839e-931c10bef6c3","resolution":{"observed_at":"2026-08-07T14:05:51.862532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:51.360788Z","title":null,"venue":null,"work_id":"7b38a666-d3fe-4814-8b13-249182b763d3","year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:37.971786Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:bf3467369aeb7198c6f6c16c0394d4923b25f541dd140e473c263e5d2ab99db9","observation_id":"e36b919b-c129-44b1-8a11-a9037a854b80","resolution":{"observed_at":"2026-08-07T14:05:51.505626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:51.011185Z","title":"Masry, X","venue":null,"work_id":"1b32942c-0a89-4a6d-ac1b-9247777f6d2d","year":2022},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:38.154480Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:c4cba2a09a2edeeb5bec9587fe0d362585c4ff5c28f87488d43cf6c140e55b09","observation_id":"06ee6e18-7cd1-4d54-a346-44c4512dfb3d","resolution":{"observed_at":"2026-08-07T14:05:51.184852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:50.700979Z","title":"Methani, P","venue":null,"work_id":"78e19216-a795-49c8-8642-0747d9013cdb","year":2020},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:38.248190Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:876f888242da2c91f8393438b203cd5f1115ef08d99e444da6e02c0fd0f37650","observation_id":"196f6d38-4993-41df-8872-b98be6224394","resolution":{"observed_at":"2026-08-07T14:05:50.848389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:50.403504Z","title":null,"venue":null,"work_id":"1905793f-8d43-4277-94e5-bb40d5bece42","year":2022},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:38.333927Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:2e33dea6d1c8e099331c2f66a13e4f7e22c4ba7db9cd23689f25291207695e7b","observation_id":"b6d7e9b8-c14f-4437-a0a8-bb74f7ec8cf3","resolution":{"observed_at":"2026-08-07T14:05:50.544657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.04378","last_updated":"2022-03-03T17:02:15Z","snapshot_observed_at":"2026-08-04T04:37:10.125024Z","submitted_at":"2021-08-09T22:38:29Z","title":"Making Transformers Solve Compositional Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.04378","snapshot_observed_at":"2026-08-07T14:05:38.474789Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:38.474789Z"},"links":{"cited_paper":"/paper/2108.04378","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:0e128fedfaf710e324f2baa107d92d2a90de3c1206a2360f8d7b38863e5992ab","observation_id":"fe102a5a-e16e-4c0b-8303-5dfa42fc70bf","resolution":{"observed_at":"2026-08-07T14:05:38.474789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:50.100637Z","title":"Okawa, E","venue":null,"work_id":"fc3304c7-2af9-4623-94d9-e7f018dada66","year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:38.580911Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:3077d46d6e5590a4fdd4db37bafcb59c93e7be1b1a99ea5fccab62992ddb220b","observation_id":"9f149caf-19a9-4704-a454-dd81cab183ce","resolution":{"observed_at":"2026-08-07T14:05:50.249267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:05:38.734949Z","title":"GPT-4 technical report.arXiv:2303.08774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:38.734949Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:7495239058a72471ca736ef52e612cc2f003c7313a227117643d373a4e7b7a24","observation_id":"6d71d73a-c66a-4afc-96ee-a41d6b3cd622","resolution":{"observed_at":"2026-08-07T14:05:38.734949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:49.657506Z","title":"GPT-4o system card, August 2024","venue":null,"work_id":"0f398096-0046-4a7b-9e29-9882ccd5ec8a","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:38.891448Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:f3a6350941e2faa9b04d178af811f3dd973eb4f9fc736aa295a22fe69f2eb672","observation_id":"09de245d-0142-4c67-93d8-0ee05fee4b95","resolution":{"observed_at":"2026-08-07T14:05:49.887153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:49.359410Z","title":"o3 system card, Apr","venue":null,"work_id":"aea0faad-6896-40d9-9d91-ced04d1ce56b","year":2025},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:39.033465Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:012301907ce0fc2a4ac54a5fc0b6b2a8334c88a98566d40bea056215a9fb3fb8","observation_id":"653b0dce-0cff-4c5e-be9c-8ce200a203c8","resolution":{"observed_at":"2026-08-07T14:05:49.504220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:49.143218Z","title":"o1 system card, Dec","venue":null,"work_id":"135e07d2-d6c9-40b1-a758-80c21f042cba","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:39.156434Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:f008ab04fdcccbec58009b73ae50d50bc4804f8e5670094c5d22ee83262e9c2d","observation_id":"52c008ae-f50c-434e-be6b-c6847f3e5d7b","resolution":{"observed_at":"2026-08-07T14:05:49.235917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:48.953145Z","title":"Ovadia, M","venue":null,"work_id":"5f9d60d4-02da-43be-90b7-b575c59a88eb","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:39.309489Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:5a530ec9495724b30052d06a4416b5b159fb8a16073fe963cc2e9d53d9b342fe","observation_id":"47820dbd-d0d4-4a2e-bee9-1ebde996c18e","resolution":{"observed_at":"2026-08-07T14:05:49.039219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:48.814515Z","title":"Paiss, A","venue":null,"work_id":"c24d5e05-0bf4-4ff4-b9ca-a6472ff09b57","year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:39.397867Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:cf1781e5fc1c9edfdf5d8f2412fb8ef90f3513675ee244cdda88a68af7d464e3","observation_id":"55371cfd-89f6-47e5-b393-db04ed947137","resolution":{"observed_at":"2026-08-07T14:05:48.874953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:48.610893Z","title":"Press, M","venue":null,"work_id":"aa0722e8-e12e-42e9-a8a3-5f58826aad03","year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:39.481124Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:6c888abef946b1d98f9b19fcc7059248c491b551ef58e4238cae73829a204ec9","observation_id":"e73d9d31-a226-4304-8698-fd69a1085cf7","resolution":{"observed_at":"2026-08-07T14:05:48.708003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:48.371157Z","title":"Rahmanzadehgervi, L","venue":null,"work_id":"b98d5506-d632-46c9-8654-fbf2fe424d25","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:39.566351Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:9092757c791c1c8f32d41a5f79e00506b76e8c392fae973085b17cb5a080be9c","observation_id":"6a9de239-60a1-4205-86b4-3b8bb3168eb3","resolution":{"observed_at":"2026-08-07T14:05:48.463697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:48.185247Z","title":"Ramesh, E","venue":null,"work_id":"11a71e88-f03a-45e3-a3a8-adc69f1719ca","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:39.681541Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:281239bb942b824e36a8a25e899091e803782ead21eea07aa22efe57b60aa352","observation_id":"f2bde55f-507c-4d53-b4df-587b7e174c78","resolution":{"observed_at":"2026-08-07T14:05:48.264217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:39.794510Z","title":"Roberts, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:39.794510Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:60f82ce8f22ac92bc6615161554646272dd331cf418b9321384261e04081e981","observation_id":"98ee4969-b97b-4c7e-b469-574c6f3b5b59","resolution":{"observed_at":"2026-08-07T14:05:39.794510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:47.967536Z","title":"Roberts, K","venue":null,"work_id":"9a1005bc-f904-41b5-b703-6a519f55ff70","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:39.855561Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:6fa5751540f9d1c1f4c13730247762dfad78e1fd14ddff42b28383a7a1d3a887","observation_id":"6c97a82e-e4ca-45d9-99c6-6132f8a6d19b","resolution":{"observed_at":"2026-08-07T14:05:48.082975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:47.778260Z","title":"Rombach, A","venue":null,"work_id":"405a0cf8-462e-47d3-93e2-ac61a7f572f1","year":2022},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:39.964791Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:96232c359ae014e6ca7365edec0c81b6d5f72e3bfb53122b80b4933f8b37f6cd","observation_id":"5ad61aff-3e58-4879-b7ea-b05517db02fd","resolution":{"observed_at":"2026-08-07T14:05:47.873471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-07T14:05:40.074623Z","title":"Rozière, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:40.074623Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:4b0e4bf9e147dcb98f0d62f85712755cb5c55418aba57fc2fe764243b4bf2396","observation_id":"d6712501-79ea-46c8-b1db-fed43894d700","resolution":{"observed_at":"2026-08-07T14:05:40.074623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:47.565853Z","title":null,"venue":null,"work_id":"65c00681-d8e2-4dda-9fbf-994cd4a31348","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:40.156806Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:8e91d6b9506498053376609e496d043611af4208fcee70670905b4b581b4f9e3","observation_id":"3c8a478e-caac-44b0-b84b-ba822c2ec787","resolution":{"observed_at":"2026-08-07T14:05:47.654058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:47.340840Z","title":null,"venue":null,"work_id":"8aaf7dd0-bf69-4b33-9746-2e5bdc3ae358","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:40.262147Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:680ea39a3bfd167ec97def0196847f4ca97ba263b4bff5c6eb850677071e89ec","observation_id":"45e93225-70a3-41df-bdcc-c154954c7115","resolution":{"observed_at":"2026-08-07T14:05:47.429234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:47.178243Z","title":null,"venue":null,"work_id":"fc093c9d-b7d3-4081-bdb8-af083fefde53","year":2021},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:40.369673Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:16cc004e191e68ec94dfc3b8e54104b110f9e030d13fd5275fc88cf3154f6a42","observation_id":"939cde22-2f98-49e4-9f8d-624e3c256e9e","resolution":{"observed_at":"2026-08-07T14:05:47.256602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:46.942611Z","title":null,"venue":null,"work_id":"8684b493-822a-488c-9e25-fa3b62965a2c","year":2025},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:40.429951Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:27edd3f4c0c605763b5da81b89c054e094e4a6e72ca895c9c10249e82f68b4dc","observation_id":"f8570060-37ff-45aa-bf45-ead4b4bfe9a8","resolution":{"observed_at":"2026-08-07T14:05:47.069010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:46.685230Z","title":"Thrush, R","venue":null,"work_id":"0eedd2a5-82fd-4de0-b81a-55d1ffadc669","year":2022},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:40.557953Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:d103fbaf32d731eea915af58fc4ba2b8c24b38ab825637260971389d29b90306","observation_id":"cd200761-bbe3-40d8-b4bd-58e560800f0e","resolution":{"observed_at":"2026-08-07T14:05:46.822160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:46.473804Z","title":null,"venue":null,"work_id":"9a37dc93-40c8-4ddb-ab97-6a480a67e057","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:40.639278Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:0f908d2d89e811913325dbcecc9754380c0fe882a0d4852a524dba6d38dec890","observation_id":"d0884905-4640-4c4c-b461-91aac94e8089","resolution":{"observed_at":"2026-08-07T14:05:46.574360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:46.208541Z","title":null,"venue":null,"work_id":"8e45858d-0df5-4619-b4d4-3aca69bb3bba","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:40.740361Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:41be854a7a1c80a4d711f31f57c2fc2d5d9d4bdec2d5e306676ffc05631c31b4","observation_id":"9b144d5b-065e-4896-b268-0e5268f97006","resolution":{"observed_at":"2026-08-07T14:05:46.340750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:45.995027Z","title":null,"venue":null,"work_id":"12dba601-95ac-479f-a42e-8ba674854aa9","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:40.803871Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:d8768ccba70b57b58d21b2ba0e34f227d8c67c50af22e9489b5e13601870b815","observation_id":"30abef7e-1847-42ca-93bf-06453b6ee176","resolution":{"observed_at":"2026-08-07T14:05:46.106985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:45.729627Z","title":null,"venue":null,"work_id":"b24d67a8-e4a4-4455-b454-cead38e7d6ee","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:40.913742Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:9ad7832eb7bc62fa42ccbda7bb5bf233cce49fac7014cd09d9520fd5b2119b7e","observation_id":"42533b49-7b12-485d-9694-ba1ab1c80c11","resolution":{"observed_at":"2026-08-07T14:05:45.873727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:45.484180Z","title":null,"venue":null,"work_id":"5ac500ec-1a84-4e1a-b50d-39618c17dc3d","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:40.997673Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:7f6f48dd6efa88a0ebb8f1089f33b1e0e1b3354103637314853aa878da94fd9d","observation_id":"6aee163f-e352-449c-aef4-d1e77d65644f","resolution":{"observed_at":"2026-08-07T14:05:45.585731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:45.279611Z","title":null,"venue":null,"work_id":"40e6d698-413f-49ae-9bbc-1a9910697d66","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:41.095837Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:3b53132b08f0c00cb20209bbf8522ade973c6be593b6c58fee31c830dbdb2fc2","observation_id":"9f70d4d5-f90b-4b00-9902-7d318c83adb7","resolution":{"observed_at":"2026-08-07T14:05:45.376294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:45.073407Z","title":null,"venue":null,"work_id":"d9183f67-a97f-4fe1-a8a3-bfab8b31d90e","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:41.161769Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:4fde64c70b9dc605cbecf6fc0c72cc63e44d6b0808b44d9aa7f4f6f232969199","observation_id":"269d781c-7b4f-450e-963a-617ca9416b4e","resolution":{"observed_at":"2026-08-07T14:05:45.146074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:44.823021Z","title":"Yuksekgonul, F","venue":null,"work_id":"d95f8f9f-d1e2-43c5-a9a8-1844b7397353","year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:41.258830Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:6a9d299e5ed7db2f5eafc4fb23ba342b5556d08709624ea97ecb8bb3a1b26588","observation_id":"59871319-7a82-486e-ae41-bd5314374d71","resolution":{"observed_at":"2026-08-07T14:05:44.955938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08737","last_updated":"2024-12-11T19:12:13Z","snapshot_observed_at":"2026-07-06T20:05:32.369933Z","submitted_at":"2024-12-11T19:12:13Z","title":"Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08737","snapshot_observed_at":"2026-08-07T14:05:41.379301Z","title":"Zhang, O","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:41.379301Z"},"links":{"cited_paper":"/paper/2412.08737","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:6468f2e7daa90b4a677c27bec37d12f98cef33b18e190b315ccda5c4f9163a34","observation_id":"6a39e83f-74bd-4625-9c10-0e87e15c6203","resolution":{"observed_at":"2026-08-07T14:05:41.379301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:44.611951Z","title":"Zhang, A","venue":null,"work_id":"fd94f869-2f74-4040-b52f-16429d10d0dc","year":2023},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:41.494083Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:86887adb1798384b50205c3e245161a1763961c9c11073633016cfca6175c47a","observation_id":"04d26674-4d12-4231-8e7c-91f6db26eaa1","resolution":{"observed_at":"2026-08-07T14:05:44.707065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:44.417811Z","title":"Zhang, D","venue":null,"work_id":"e8ef09cb-bf76-4e2a-9ec1-08af23d5a065","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:41.555609Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:b6094be8330cb4627f6fd045a17edabde906b7a1de1a3c982ffcd9b011e122a9","observation_id":"216b50ac-f24e-4cdb-9b21-24e589a7828d","resolution":{"observed_at":"2026-08-07T14:05:44.526771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:44.300655Z","title":null,"venue":null,"work_id":"ddf3a28c-8f18-4eeb-807b-14988f74f0df","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:41.663048Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:3f6238f017ef3444e59311f4362359b4c3cc5bf04a6e8e567f7323e3082c7760","observation_id":"d05d4abb-9423-4097-9b59-01f634055b42","resolution":{"observed_at":"2026-08-07T14:05:44.363072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-05T08:04:30.259196Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-07T14:05:41.725304Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:41.725304Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:fd74bc547225dbd1aeedaff23f4fb7d0d5b752ba15884e934343d3a2a0ce2222","observation_id":"7b581a1c-981d-4577-bf25-65524f03fa8f","resolution":{"observed_at":"2026-08-07T14:05:41.725304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:44.089451Z","title":"Zheng, X","venue":null,"work_id":"f969b424-e702-48b0-ba83-057c398be830","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:41.813669Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:e93f651bbb3085261e5499c6d479098dfa2a8bb2199d1c8a18d907d609a8d884","observation_id":"8ab0d4a5-0106-4b42-9ce7-830c8a5c0364","resolution":{"observed_at":"2026-08-07T14:05:44.174978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:43.897670Z","title":"positioned in between,","venue":null,"work_id":"6c323f01-ea24-47bc-ba47-b4e8e63acf14","year":2024},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:41.935542Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:b219189add0e09c3e24073eed5cbc7d9cf0ba541c4dc93d0d38ae05e99b66a27","observation_id":"cc231e01-55d9-4eae-a0d3-2305d9c4f1f0","resolution":{"observed_at":"2026-08-07T14:05:44.004784Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:43.675293Z","title":null,"venue":null,"work_id":"71c67631-764c-4314-bf3f-81303e5957d3","year":null},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:42.026236Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:f0972291ad4432a8beff8b9c2bdef1fced59fa74cfd89966ad85a76b6c0af287","observation_id":"f1fe5e20-9612-4d33-8f16-4e2af5428854","resolution":{"observed_at":"2026-08-07T14:05:43.787447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:43.474957Z","title":null,"venue":null,"work_id":"d9cb673b-fe3d-46c5-8650-ee712fd4a0a2","year":null},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:42.125407Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:321556d0097237dad9258e0ba894953e33b943672c0a428b58d7272d2120a169","observation_id":"2ce947f5-b8aa-4a49-ae98-0ae21ceb9775","resolution":{"observed_at":"2026-08-07T14:05:43.574047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:43.258326Z","title":"Diagram on {BACKGROUND}","venue":null,"work_id":"c6353c79-e456-4b50-8161-816aaba13e89","year":null},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:42.207499Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:60677bcc87d609bb42d897bf061f7a4b2f0e8d72255b75e3ba1bea6b98ca4a0e","observation_id":"16def75c-ac7f-48fc-a6e9-a83d06060753","resolution":{"observed_at":"2026-08-07T14:05:43.385816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:43.014458Z","title":"For instance, we forced the distance between any point or text to not be too close and indistinguishable","venue":null,"work_id":"90da0b42-7c12-43c3-8f0b-7ccee412f9ae","year":null},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:42.322183Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:d31b104e279a4e746c0771536b3705c84cf1c0377939833bcdb87cdcef130a25","observation_id":"13172535-6613-41cb-ba5f-f5c5e78e9c8d","resolution":{"observed_at":"2026-08-07T14:05:43.142955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5100.0100","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:05:42.628713Z","title":"true” or “false","venue":null,"work_id":"f68d3bb2-c9aa-4208-8de7-616eeb08ebaa","year":2025},"citing_paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:42.456961Z"},"links":{"citing_paper":"/paper/2505.20021"},"observation_digest":"sha256:61741160a03a9257f748631183272e2c6df34024e9c5c721baa90fa486cb4e9e","observation_id":"f32108f6-6526-4bd2-9ba6-d54fff3708da","resolution":{"observed_at":"2026-08-07T14:05:42.692797Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20021","last_updated":"2025-05-26T14:09:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:58:49.414444Z","submitted_at":"2025-05-26T14:09:24Z","title":"Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 1 inbound Pith citation observation for arXiv:2505.20021."}