{"as_of":"2026-08-15T08:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3de5948cf390c39d1a103e38d065b19b5a814daff435904dbcddbe451f5c8e2","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:38:24.547522Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.15144/citation-record","integrity":"/paper/2501.15144/integrity","json":"/paper/2501.15144/citation-record.json","paper":"/paper/2501.15144"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T14:38:24.015154Z","title":"Abdin, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.015154Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:70242600a6b0536fafbe638381231ffef934f36f8d0c2bff5fc1d8668205f03c","observation_id":"b9600f08-70cc-46cc-8d16-9e5bd6b977ae","resolution":{"observed_at":"2026-08-10T14:38:24.015154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.885655Z","title":"Alayrac, J","venue":null,"work_id":"ab8ba3bc-a27e-4a72-a15a-c524374216c4","year":2022},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.020398Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:95c5082632979bba09043e089a1f2bdced16759cbf1591ce36de92fba238e04c","observation_id":"0a930986-248c-450f-9d8e-60d6af521c45","resolution":{"observed_at":"2026-08-10T14:38:25.890814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T14:38:24.025536Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.025536Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:365176861edd7302a4fa3d5d5d6095c9d3448769435d8894f4700e14cf880ef6","observation_id":"fe7bcbf2-fa40-4db2-a84a-a1d8bbfed217","resolution":{"observed_at":"2026-08-10T14:38:24.025536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-10T14:38:24.045964Z","title":"Beyer, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.045964Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:708e254aa629336838a480bb736395ccbdfc10c2a0949968950290e59ea7f555","observation_id":"940a74c5-8ba4-48df-a740-0a32275092f2","resolution":{"observed_at":"2026-08-10T14:38:24.045964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.871570Z","title":"Carion, F","venue":null,"work_id":"c4cb2688-a70a-45d0-97a7-13fbfa64636a","year":2020},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.156760Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:2c0b7e6822f4793e1a5ecd5526b782121cbfd48f733b2edde870d30327b38760","observation_id":"10576d6b-f8c2-49ee-b744-fed08389c296","resolution":{"observed_at":"2026-08-10T14:38:25.875882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.729069Z","title":null,"venue":null,"work_id":"7af5360a-d84b-4a79-bcaf-9587125baf83","year":2016},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.193224Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:ab753b8285fdb29f728cbbd74d9c75ac45e3fe3d8916c4332beab1d605deedd2","observation_id":"3c1a8817-28ba-4336-8eb7-c38a2dcd6382","resolution":{"observed_at":"2026-08-10T14:38:25.861327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T14:38:24.199332Z","title":"Dubey, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.199332Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:9d42498e92308bad6eb2350211fb056f4a2b411e9ff744fd2b8c357bef6814fd","observation_id":"4dceec40-7eab-41d6-9659-523db1b678d9","resolution":{"observed_at":"2026-08-10T14:38:24.199332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.648847Z","title":null,"venue":null,"work_id":"8d6f6f88-0932-4764-abd8-d79783cd6f17","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.204219Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:be3c6b9fe05f0ce07728b3c3fe0211b7602c7e0cb09faf1c14100bc450c2653b","observation_id":"238f5e4a-4b42-4556-a9d0-95e355648d00","resolution":{"observed_at":"2026-08-10T14:38:25.654140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.633683Z","title":null,"venue":null,"work_id":"eab60c12-11ce-4ef2-aea3-96ba0cf3fcfd","year":2001},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.209906Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:236071cd0967a749d0a6793a6659c1ef1b811c8d505993742846bb7da199fdeb","observation_id":"6b657000-0ba8-412d-aa29-55ab72f5b5b0","resolution":{"observed_at":"2026-08-10T14:38:25.639103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.619668Z","title":"Kv and A","venue":null,"work_id":"9fb0d110-b6df-468a-9219-17415b356aa8","year":2020},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.214634Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:3c3eae1867e1a88191a048eb571a3b072cbc3daa79dd82ef546ce46e92cc9f11","observation_id":"bec82237-c7d1-4272-81e2-49e398be6a08","resolution":{"observed_at":"2026-08-10T14:38:25.623751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.525678Z","title":null,"venue":null,"work_id":"f41cee42-0857-401d-a7b0-7ad55d885345","year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.219493Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:1a92470882cc42902bf867b62b51904b98853729c2468241464946e2520025ab","observation_id":"0977a93c-da7a-4db5-8d65-abb39d5a0576","resolution":{"observed_at":"2026-08-10T14:38:25.609875Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.399659Z","title":"Minervini, A","venue":null,"work_id":"2e6fdc9a-2c39-4f9d-9803-4f0a0f7da039","year":2016},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.223550Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:acbc66e3a9c403a7f08206406527f1bd28c47e95baf6f49506e4324e090ccb62","observation_id":"5d547e25-110d-46d1-9a00-7089337b122f","resolution":{"observed_at":"2026-08-10T14:38:25.420462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14544","last_updated":"2024-06-20T17:54:03Z","snapshot_observed_at":"2026-08-13T02:55:40.615388Z","submitted_at":"2024-06-20T17:54:03Z","title":"Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs","version":1},"cited_work":{"arxiv_id":"2406.14544","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14544","snapshot_observed_at":"2026-08-10T14:38:24.730733Z","title":"Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs","venue":"cs.CV","work_id":"bf926c71-6044-4d03-aee7-209bf6897cb3","year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.228150Z"},"links":{"cited_paper":"/paper/2406.14544","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:08b6931a38d35eaf94a597000ec2672c46e527b57ba476e1fc897e3a8cf94767","observation_id":"b1114157-1104-4bb7-a156-a3ff464717d8","resolution":{"observed_at":"2026-08-10T14:38:24.771826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.384834Z","title":"Radford, J","venue":null,"work_id":"d903ba79-9b1d-4cae-b459-d0692ecfe607","year":2019},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.233127Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:3d8b24e17f95cf28df2178fe156dbf5b752c7fc22ee75afac3ba0806172547ed","observation_id":"d6e0c9c3-502f-4b1d-8630-292561fcc54d","resolution":{"observed_at":"2026-08-10T14:38:25.389601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-14T20:43:04.530971Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-10T14:38:24.238672Z","title":"Rahmanzadehgervi, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.238672Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:af575fac88af924b3b7156771ae239ecf9231fe61a50396bbc8e81cfb878b0bc","observation_id":"4492f9b0-c03f-4c34-9738-dd928133df44","resolution":{"observed_at":"2026-08-10T14:38:24.238672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.369857Z","title":null,"venue":null,"work_id":"d38d2850-b95c-43e2-bf69-1c0b68dcba4b","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.293516Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:25c468ff887dc3a1732d6858ad30380543f5d2005ed08766204a9c763fe2b5d4","observation_id":"235333c6-971a-48ab-9389-ae5ccdd6eb78","resolution":{"observed_at":"2026-08-10T14:38:25.374655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.276350Z","title":"Salewski, A","venue":null,"work_id":"0c29eb07-6707-49b2-98fe-8357ff2659d8","year":2020},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.411039Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:c805f85443c9ea21fbb598f339f58c08a2f097d5704eb4da007b8543b7861cfa","observation_id":"c63b0f55-e4ae-4d82-a09a-99c4ce743a26","resolution":{"observed_at":"2026-08-10T14:38:25.358212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.133020Z","title":null,"venue":null,"work_id":"c6767aa0-ac97-4378-96d2-cb192be78a6c","year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.481439Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:32d1ab0cc101f1d688845c1761386ba1d72841b0695db254f10482479c8d50c2","observation_id":"96a05e5f-1e9b-4574-be11-c733b22f262a","resolution":{"observed_at":"2026-08-10T14:38:25.176242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19237","last_updated":"2024-06-28T05:43:46Z","snapshot_observed_at":"2026-08-14T01:12:08.978618Z","submitted_at":"2024-06-27T15:01:48Z","title":"FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19237","snapshot_observed_at":"2026-08-10T14:38:24.505902Z","title":"Singh, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.505902Z"},"links":{"cited_paper":"/paper/2406.19237","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:62341ffe90b6178f2a489a0b8a82d52eb09c4364177cbaf053722cc100f1f10c","observation_id":"6eef9f09-924d-460d-8b05-be5df45f10d9","resolution":{"observed_at":"2026-08-10T14:38:24.505902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09269","last_updated":"2024-12-12T06:26:09Z","snapshot_observed_at":"2026-08-14T20:13:19.875821Z","submitted_at":"2024-09-14T02:29:36Z","title":"Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09269","snapshot_observed_at":"2026-08-10T14:38:24.510393Z","title":"Sinha, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.510393Z"},"links":{"cited_paper":"/paper/2409.09269","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:b0348b0062e18bc6032f0c901063ad34342cc160467a5885bc32a9b75eb50e62","observation_id":"e1cdf967-880c-4933-8791-c87a16da6ac7","resolution":{"observed_at":"2026-08-10T14:38:24.510393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T14:38:24.514755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.514755Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:7eb5eed7249d7244b4963d0fe138a32c3bd0b4d9d1cb7ac863e6c3c21c8ac5ac","observation_id":"d08b5476-9cec-49ff-883a-52c4d94ca8a0","resolution":{"observed_at":"2026-08-10T14:38:24.514755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T14:38:24.519030Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.519030Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:8b12905d89c879565b41a4f54d1795483e1764052b3953d8281431fd5bc7e850","observation_id":"0cb8647d-f12e-44d0-bd35-61754c089210","resolution":{"observed_at":"2026-08-10T14:38:24.519030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T14:38:24.523145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.523145Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:87c02dbd13f973fbeef4fe56ece2d2ac990e9ab58dd511e6ab1e6a7dcbe8c24f","observation_id":"a700a717-608f-4fbb-b18d-4bd2b1c7d44b","resolution":{"observed_at":"2026-08-10T14:38:24.523145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.117451Z","title":"Specifically, the shape limit is increased to 5–6 shapes per image, and the occlusion limit is also raised to 5–6 shapes","venue":null,"work_id":"cfb17dba-28b7-4b12-94ec-57ba31f52f22","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.528507Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:ac25de676548eb42c93d0c6eb8124d224ec50de5a3a6eaaefdcf94c24f3ab335","observation_id":"9eea5803-ea97-434c-ace7-79e3569581ad","resolution":{"observed_at":"2026-08-10T14:38:25.121899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:25.102242Z","title":"This setup tests the model’s ability to detect and attribute more shapes in configurations that were not present in the training data","venue":null,"work_id":"38e30962-5274-456a-a3a3-0ec70adf8630","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.533223Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:c52f242640c2da5349c3576faa37bc460f24f9fd5c664e75d0e639d8cf9729ae","observation_id":"06aa8683-e30e-4912-a802-ed735ad8f655","resolution":{"observed_at":"2026-08-10T14:38:25.106796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:24.966921Z","title":"This scenario assesses the model’s ability to accurately detect and attribute shapes under previously unseen levels of occlusion","venue":null,"work_id":"a1e21861-9a56-4af5-b110-17ec1e5d04fe","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.538152Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:6e1c3f3c18c8fcf57a959f6bd568ebb30a31af18bde29efad4d583285407dda5","observation_id":"628f8bf5-7b8d-4947-b61f-b63869b57ebf","resolution":{"observed_at":"2026-08-10T14:38:25.038081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:24.874858Z","title":"The ability to generalize to these out-of-domain rotations Model OD Comp","venue":null,"work_id":"7ad2203a-6467-4431-b556-9151ce0e8043","year":null},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.543002Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:b86ce9a26d4627c7230bf9dc5f106fa178238d0e298bc1e231a41cd8baa106b1","observation_id":"c0a8e2e7-c228-495c-b296-9ff3fdc85bc8","resolution":{"observed_at":"2026-08-10T14:38:24.879894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:38:24.859668Z","title":"Sentence Format Tuple Format MiniCPM-V2.5 Figure S4. Sentence Vs Tuple Output Comparison for MiniCPM-V2.5 Models for Validation Dataset","venue":null,"work_id":"01d53ea0-2619-471d-928d-2b8e4aef062e","year":2000},"citing_paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:38:24.547522Z"},"links":{"citing_paper":"/paper/2501.15144"},"observation_digest":"sha256:81060694ebc83c286e03f46882aaa4d28b29893299c891c4a5c0d6f45c4ef368","observation_id":"1387a2fc-f641-4791-98f9-ac2311053ecc","resolution":{"observed_at":"2026-08-10T14:38:24.864409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.15144","last_updated":"2025-09-02T09:32:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T01:59:28.492817Z","submitted_at":"2025-01-25T09:01:37Z","title":"Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2501.15144."}