{"as_of":"2026-08-10T13:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3f4cf418c75e6c53e246b1300ee1eb048989b3d8587fc23cd6ba1441f83288d","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:58:26.760637Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08266/citation-record","integrity":"/paper/2509.08266/integrity","json":"/paper/2509.08266/citation-record.json","paper":"/paper/2509.08266"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23941","last_updated":"2026-04-19T17:09:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T18:47:58Z","title":"Vision Language Models are Biased","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23941","snapshot_observed_at":"2026-08-04T20:58:24.320688Z","title":"Vision language models are biased, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:24.320688Z"},"links":{"cited_paper":"/paper/2505.23941","citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:634c805432f6d1d2b67e69eaf3d81992da0973ba1d29635f8fe4096b6355a039","observation_id":"8bbe823e-462c-40e3-b69f-d81d2a79d9d7","resolution":{"observed_at":"2026-08-04T20:58:24.320688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:30.233659Z","title":"Open ai: Introducing openai o3 and o4-mini, 2025","venue":null,"work_id":"b9216ae9-41e4-4c88-a171-53452bd3acb4","year":2025},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:24.418011Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:5a17058d750cd98b047f6e282b3c8888aff65e9af053e539657a2d494eaea955","observation_id":"401146e2-0882-438c-8edd-f1ed24fb398a","resolution":{"observed_at":"2026-08-04T20:58:30.323971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:30.048416Z","title":"Google deepmind: Gemini 2.5 pro, 2025","venue":null,"work_id":"afc69b5e-4d82-4b28-bedb-583782bb9deb","year":2025},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:24.537822Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:2059fda8ac942f85f44299a370b92fb9c2d8e66a349f8a5a4bf7673211d8fc23","observation_id":"5a50d699-9317-403e-b6f0-fa7c18a6eef9","resolution":{"observed_at":"2026-08-04T20:58:30.136766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00193","last_updated":"2025-05-25T18:16:26Z","snapshot_observed_at":"2026-07-06T19:24:52.534713Z","submitted_at":"2024-09-30T19:45:11Z","title":"Do Vision-Language Models Really Understand Visual Language?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00193","snapshot_observed_at":"2026-08-04T20:58:24.649412Z","title":"Do vision-language models really understand visual language?arXiv preprint arXiv:2410.00193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:24.649412Z"},"links":{"cited_paper":"/paper/2410.00193","citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:125cbe349ea77d3eb2309b4fb81f4e12d77e5e4c46ab33ebe92a2896044110dc","observation_id":"9f01fb84-53a7-4d57-8174-b08f4d95fdad","resolution":{"observed_at":"2026-08-04T20:58:24.649412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08702","last_updated":"2025-02-08T23:14:12Z","snapshot_observed_at":"2026-07-06T18:30:02.349638Z","submitted_at":"2024-06-13T00:00:20Z","title":"VLind-Bench: Measuring Language Priors in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08702","snapshot_observed_at":"2026-08-04T20:58:24.757401Z","title":"Vlind-bench: Measuring language priors in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:24.757401Z"},"links":{"cited_paper":"/paper/2406.08702","citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:4da7f61a687eb26ba822a58c54c00735a41d4b8e6a36e01718e13a2d16e48a6e","observation_id":"42696a3c-e460-4e02-b84b-5a5fa5eeee81","resolution":{"observed_at":"2026-08-04T20:58:24.757401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:29.781453Z","title":"Vhelm: A holistic evaluation of vision language models.Advances in Neural Information Processing Systems, 37:140632–140666, 2024","venue":null,"work_id":"ea0ecbbc-c0e0-4742-ab0a-2e041afd4c3a","year":2024},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:24.886900Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:5fa9f0856e344ca5cb9605ad3a5664f45d92d7a72f6294bba2dffed91fc5c601","observation_id":"a831130e-7f07-4a94-b749-20bb5a609c37","resolution":{"observed_at":"2026-08-04T20:58:29.845483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05445","last_updated":"2025-04-07T19:16:56Z","snapshot_observed_at":"2026-08-07T16:07:49.275222Z","submitted_at":"2025-04-07T19:16:56Z","title":"Probing the Visualization Literacy of Vision Language Models: the Good, the Bad, and the Ugly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05445","snapshot_observed_at":"2026-08-04T20:58:24.989862Z","title":"Probing the visualization literacy of vision language models: the good, the bad, and the ugly.arXiv preprint arXiv:2504.05445, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:24.989862Z"},"links":{"cited_paper":"/paper/2504.05445","citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:f71c87a5310007ff7d7ca8fdf8aa8623ab8bdb4e287c7a91d014c0408e976b74","observation_id":"6d34adfe-0899-4e2c-9216-88ccf8b798d7","resolution":{"observed_at":"2026-08-04T20:58:24.989862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17820","last_updated":"2025-05-31T02:41:34Z","snapshot_observed_at":"2026-08-08T02:36:07.552587Z","submitted_at":"2024-05-28T04:40:57Z","title":"Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17820","snapshot_observed_at":"2026-08-04T20:58:25.135570Z","title":"Don’t miss the forest for the trees: Attentional vision calibration for large vision language models.arXiv preprint arXiv:2405.17820, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.135570Z"},"links":{"cited_paper":"/paper/2405.17820","citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:bfce3503f0eb45c24a16a852f88751eafef6e79b0b6eb9e81522ee4eed3dffb2","observation_id":"15927bdb-d807-466a-911a-3ca3587833fb","resolution":{"observed_at":"2026-08-04T20:58:25.135570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:29.583995Z","title":"Mitigating object hallucinations in large vision-language models with assembly of global and local attention","venue":null,"work_id":"7fc3c54a-bce6-4d78-956f-a4ce8c8bcc70","year":2025},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.210104Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:f80cc6fd9cf5ad09996dad31ea05f630385eee8a70c0cc2ddae5aa003941d137","observation_id":"4b317174-849f-4293-b417-c7c08d6f86af","resolution":{"observed_at":"2026-08-04T20:58:29.632342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-07T17:28:11.499465Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-04T20:58:25.290792Z","title":"See what you are told: Visual attention sink in large multimodal models.arXiv preprint arXiv:2503.03321, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.290792Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:a416eeb7a14e45315812236c620cd4381e4382b0cfdf81133d83e524903f3b62","observation_id":"65ddff21-ce30-45c1-9483-4fd7cbd0887b","resolution":{"observed_at":"2026-08-04T20:58:25.290792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:25.372227Z","title":"Qwen2.5-vl, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.372227Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:11c2fa882a5e7d071485c77be0fabb20e59d31aef7cec20960007e4d6e8436d7","observation_id":"088d296f-b968-48ad-bad2-d164b2ac3698","resolution":{"observed_at":"2026-08-04T20:58:25.372227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-04T20:58:25.467092Z","title":"bbox_2d\": [100, 253, 194, 437],","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.467092Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:327f0616622d1b5c2be9bf6789db1caf2479e0bf8735ee5627ce39363d2ba062","observation_id":"0d57f32d-4e42-4dd6-a132-2d26bd3076d7","resolution":{"observed_at":"2026-08-04T20:58:25.467092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:29.394094Z","title":null,"venue":null,"work_id":"8a5a7ae0-9683-4d14-83c7-d7934a46b8a3","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.565607Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:b1d9d2655c3ffb52dbae941964ca834769d933de9c73b68ee919e182e684153b","observation_id":"9dae0dc1-d113-46ce-93d8-f074cc831067","resolution":{"observed_at":"2026-08-04T20:58:29.516499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:29.224846Z","title":null,"venue":null,"work_id":"fccf8aaa-ebe7-4110-99ad-006c78d62fc3","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.660579Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:0e5131e6f2d059a4d4566662d2f788f063a910d905993725689e65d965decbfd","observation_id":"82fc1942-6ff6-48f2-a64b-25d2d07aeddf","resolution":{"observed_at":"2026-08-04T20:58:29.272055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:29.010926Z","title":null,"venue":null,"work_id":"2671b07b-f6b2-4803-bdf8-be0c2e489769","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.723912Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:c740e857dedf599a3065c1fb2c854240caa0a3864fb924a1243dc4080eb58e36","observation_id":"df664d15-dfa3-41ba-8c56-15d0995bc94c","resolution":{"observed_at":"2026-08-04T20:58:29.061393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:28.790382Z","title":null,"venue":null,"work_id":"7e7e8ffe-cac4-4d01-9f6c-f849c98e16f2","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.849248Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:15a5de1b592ac02e95ab020e4fdb3357a62377afbefa184b5edd91e5ed3f25a9","observation_id":"112c2379-fe21-4f38-97ed-77e6e4658966","resolution":{"observed_at":"2026-08-04T20:58:28.837798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:28.559780Z","title":"We report these metrics over Qwen2.5-VL-7B, Qwen2.5-VL-32B and Kimi-VL-A3B","venue":null,"work_id":"a422ddfc-5be6-41ee-a401-ec4fa38c97b0","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.949159Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:f915ade991906840d1e649180671e083be4aea4beae222dd0c09b318802de911","observation_id":"f2bc3755-82a8-4d66-a4b7-cf976b1af856","resolution":{"observed_at":"2026-08-04T20:58:28.617063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:28.359355Z","title":"In Flag Stars, specifying the target object and requiring structured output substantially increases accuracy (up to 0.4; Figures 8 and 9)","venue":null,"work_id":"fbc6a033-c50d-46f6-8d99-ebea550b11f8","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:26.085382Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:b49d4631fca9c335542e8737d7c17009ab4a0f63792c31ce098bee27b3042e0e","observation_id":"1ed5b933-1c0a-4ca8-8453-642c384360be","resolution":{"observed_at":"2026-08-04T20:58:28.422583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:28.115910Z","title":"Refer Figures 5,6 and 7","venue":null,"work_id":"189f48e5-5e20-40da-a72a-118639d25991","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:26.172634Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:eeb1b5fbef0b378597db5adc362dfc55eeb7db57ad423a958c7ab20e7e6e3bde","observation_id":"d64897c2-e6a6-488a-b583-2d0ead436151","resolution":{"observed_at":"2026-08-04T20:58:28.218182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:27.879731Z","title":"We can see that the proportion of attention across the same prompt for different object shapes are within a very small interval","venue":null,"work_id":"e4c2563a-3e59-4820-bd5e-70c55e746abb","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:26.255914Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:67a2f7968f0204c666cb3d65973fcd3a232d58f1a142e6227a662d320635d99d","observation_id":"28fd5db4-1fd8-465e-bdae-e4042f821720","resolution":{"observed_at":"2026-08-04T20:58:27.939333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:27.709027Z","title":"When the number of objects in the image is <10, the models perform relatively accurately, but counting performance becomes less accurate as we move towards the >40 bucket","venue":null,"work_id":"b813d72c-a720-4dd6-8610-33a5b587876f","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:26.369271Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:56a41846a46f3e982886150d4eadaddab5d1138716c8e0512c66790aa4a3e012","observation_id":"5dd5e933-aa7c-4eab-b042-7da77c559e15","resolution":{"observed_at":"2026-08-04T20:58:27.748866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:27.491532Z","title":"Errors for Qwen 2.5-VL are centered mostly around negative values, meaning the model often underestimates compared to ground truth","venue":null,"work_id":"e350402f-ea04-4c08-a5a4-15033f08778b","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:26.458136Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:e4cad30abfced0e4b906210e6ea1526655f7b3d6d3646b388aa028ea484b2c36","observation_id":"eee89944-913f-45a8-8018-bd2c559f5bac","resolution":{"observed_at":"2026-08-04T20:58:27.549741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:27.289096Z","title":"Refer Figures 8 and 9","venue":null,"work_id":"7e2f35e6-b596-452a-907f-289bfac851ce","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:26.564356Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:a8197493dc6d946869e77e01cd96e058bb189cfbe7801daa2669d21d05169922","observation_id":"8d70d92a-852e-4597-b085-c4614e156384","resolution":{"observed_at":"2026-08-04T20:58:27.330933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:27.080069Z","title":null,"venue":null,"work_id":"36881338-ad29-41ec-8438-2b4dbf3a154d","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:26.675080Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:78e5b5ce52d96dc22576800c9398945abdcb8987477f04a741a02ab1684fb164","observation_id":"675d7e65-d541-4b06-a7be-441f0b0639a3","resolution":{"observed_at":"2026-08-04T20:58:27.138585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:58:26.938265Z","title":"[1], when using the same prompts and data as them","venue":null,"work_id":"e09289a6-80f9-491d-9877-370ae72cb919","year":null},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:26.760637Z"},"links":{"citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:6fe379697e80f6eac8ddbcf2e7ec55f61c82923e91528e7c33276ba7071f62e7","observation_id":"0ffc17cc-26f5-4d94-80b4-55c3c9bb822f","resolution":{"observed_at":"2026-08-04T20:58:27.003109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T13:42:52.750674Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2509.08266."}