{"as_of":"2026-08-15T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:36eb0227c9bf3c2e0ea9ca5310021d886537585562b56aa283fe25d93c454ff5","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:05:29.568947Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.15201/citation-record","integrity":"/paper/2411.15201/integrity","json":"/paper/2411.15201/citation-record.json","paper":"/paper/2411.15201"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:05:29.514856Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.514856Z"},"links":{"citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:0fa1a15b93e1545325e60b5c4606e55ae6e49afb270bdcc563dd55e19783633d","observation_id":"a50b815b-ee9a-401f-ad57-623a48141d41","resolution":{"observed_at":"2026-08-12T17:05:29.514856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:05:29.518129Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.518129Z"},"links":{"citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:90cacddfc2e6190925fd56365780c3eda4939f98572073bce0574695dd68632b","observation_id":"72867fcf-136c-4c32-95c1-bd0478f264a2","resolution":{"observed_at":"2026-08-12T17:05:29.518129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11865","last_updated":"2024-08-17T17:40:52Z","snapshot_observed_at":"2026-08-12T23:02:08.714691Z","submitted_at":"2024-08-17T17:40:52Z","title":"How Susceptible are LLMs to Influence in Prompts?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11865","snapshot_observed_at":"2026-08-12T17:05:29.520919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.520919Z"},"links":{"cited_paper":"/paper/2408.11865","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:0c8f01a131d73f0094c41b2050a09222f7f53c4f9f857a5f662f2e64ced728d2","observation_id":"7943c39f-5f6e-4d50-927a-b77c4caff949","resolution":{"observed_at":"2026-08-12T17:05:29.520919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:05:29.523863Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.523863Z"},"links":{"citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:81f19141dd72ef60ca03e78f9bbfaf906c65a55801c8fe280458a2e8e30ea475","observation_id":"38d3f405-07bd-4c5c-831e-4e1407805306","resolution":{"observed_at":"2026-08-12T17:05:29.523863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:05:29.527084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.527084Z"},"links":{"citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:942fd1ef4c4a3003c30e9fc9bfb6ee2d6d1ac0f95aed8a0fdbe3c43c61fdbb87","observation_id":"fa7b33ce-7e6b-46f1-a249-0d61e2c457b3","resolution":{"observed_at":"2026-08-12T17:05:29.527084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.07396","last_updated":"2016-03-24T00:02:58Z","snapshot_observed_at":"2026-08-14T22:04:42.587173Z","submitted_at":"2016-03-24T00:02:58Z","title":"A Diagram Is Worth A Dozen Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.07396","snapshot_observed_at":"2026-08-12T17:05:29.530090Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.530090Z"},"links":{"cited_paper":"/paper/1603.07396","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:b68f51f7776c7cae16c4eea2f4dae5da761d6ed9716da89905618675cb147737","observation_id":"1ceac050-f95e-4418-9e91-f931a51fc0b4","resolution":{"observed_at":"2026-08-12T17:05:29.530090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-12T17:05:29.533185Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.533185Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:b4e2d62bf1f0c1594542b61566f75368f2a6d70c635c74d609da616e51147046","observation_id":"ead30a38-8a77-4778-a5dd-5a47d4bee969","resolution":{"observed_at":"2026-08-12T17:05:29.533185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5706.2019","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:05:29.710257Z","title":null,"venue":null,"work_id":"b69a72da-1d97-42bd-8481-c6e48bc27417","year":2019},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.536469Z"},"links":{"citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:2b2d2692075bb4153afad1941e2e27ab1f6d894b7bcd2b53ac20b7e3536ba464","observation_id":"c9f8cc8f-4ce3-4813-8ec7-8e7910634cdb","resolution":{"observed_at":"2026-08-12T17:05:29.713825Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:05:29.745613Z","title":null,"venue":null,"work_id":"efbda031-2256-4c61-84f7-4c51d23d5efc","year":2024},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.539558Z"},"links":{"citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:22fa7bb729546f4cb98b950caa7c993b22e3859a369a18b5c70e2cdfd1763cfb","observation_id":"cbb32688-9ecc-4d4e-83fa-077b4d7dbba2","resolution":{"observed_at":"2026-08-12T17:05:29.748519Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09927","last_updated":"2024-12-08T19:15:26Z","snapshot_observed_at":"2026-08-12T22:44:25.935920Z","submitted_at":"2024-09-16T02:04:33Z","title":"Towards Data Contamination Detection for Modern Large Language Models: Limitations, Inconsistencies, and Oracle Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09927","snapshot_observed_at":"2026-08-12T17:05:29.543359Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.543359Z"},"links":{"cited_paper":"/paper/2409.09927","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:35a163990a1324e944a166de9a2ef7cfe7540fce775117394bdc155aa210f5d9","observation_id":"a86f3c66-d3e3-47e7-947b-75ebb55d69f5","resolution":{"observed_at":"2026-08-12T17:05:29.543359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05391","last_updated":"2023-08-10T07:12:11Z","snapshot_observed_at":"2026-08-14T18:08:10.594744Z","submitted_at":"2023-08-10T07:12:11Z","title":"Enhancing Trust in LLM-Based AI Automation Agents: New Considerations and Future Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05391","snapshot_observed_at":"2026-08-12T17:05:29.546552Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.546552Z"},"links":{"cited_paper":"/paper/2308.05391","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:e5557dd0f1d823b43eaed5e5f5e9680e2b953ede69889ac19fd38defcbe490a4","observation_id":"56057d6d-cec6-496d-8f46-8be555afd0c7","resolution":{"observed_at":"2026-08-12T17:05:29.546552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09318","last_updated":"2025-07-04T17:19:12Z","snapshot_observed_at":"2026-08-12T22:45:04.150125Z","submitted_at":"2024-09-14T05:31:29Z","title":"ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2409.09318","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09318","snapshot_observed_at":"2026-08-12T17:05:29.637273Z","title":"ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models","venue":"cs.CL","work_id":"cc470cc4-5fec-4b94-bf13-e60bb4e7318f","year":2024},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.550308Z"},"links":{"cited_paper":"/paper/2409.09318","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:118340fec6e6701f84895d431743df046d2aaa61fa561ed7f5c9828b31986d3d","observation_id":"d8c64b50-2f5c-4cca-9319-3864444ff4ca","resolution":{"observed_at":"2026-08-12T17:05:29.643242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-08-14T17:00:06.251776Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-12T17:05:29.553692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.553692Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:7ca36313a6fc3e62bff33701e0d7e72cf5bd53155de23ef67010585f5a306311","observation_id":"e7ed00f1-719c-48bf-a3db-6ade57f9bc00","resolution":{"observed_at":"2026-08-12T17:05:29.553692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-12T17:05:29.556277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.556277Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:01e741062bf567f00e604b6480537a04dacc237bd363cb91a360ebb2dbe841d1","observation_id":"fac9e23d-29b5-4e23-a62a-1a1a1ab71a30","resolution":{"observed_at":"2026-08-12T17:05:29.556277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:05:29.559049Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.559049Z"},"links":{"citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:4c5b6e81ed71c8ea4cd99830822efc2afa6993ddd7c3c5b0d7269785542ac0a3","observation_id":"54ba0670-dd8d-4bf3-91fa-110e3655d6af","resolution":{"observed_at":"2026-08-12T17:05:29.559049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10340","last_updated":"2025-03-07T04:01:59Z","snapshot_observed_at":"2026-08-13T04:17:58.615996Z","submitted_at":"2024-02-15T22:01:45Z","title":"On the Vulnerability of LLM/VLM-Controlled Robotics","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10340","snapshot_observed_at":"2026-08-12T17:05:29.561341Z","title":"Sadler, Dinesh Manocha, and Amrit Singh Bedi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.561341Z"},"links":{"cited_paper":"/paper/2402.10340","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:6d4fe9383886e21d047c27205a1f1834e7a892108723833f34fc80d6ad4cbe64","observation_id":"65fce983-7336-4619-a91d-254b60dda55a","resolution":{"observed_at":"2026-08-12T17:05:29.561341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-12T17:05:29.563777Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.563777Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:1639d20a239fc6f40c5b8cbb969168a7bcbd368c65a7e1f8e86a7b4c26068801","observation_id":"e9f988b2-2ba3-4580-945b-28b375dd7fd5","resolution":{"observed_at":"2026-08-12T17:05:29.563777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07840","last_updated":"2024-10-09T02:03:26Z","snapshot_observed_at":"2026-08-14T16:24:46.112333Z","submitted_at":"2024-07-10T17:00:29Z","title":"Decompose and Compare Consistency: Measuring VLMs' Answer Reliability via Task-Decomposition Consistency Comparison","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07840","snapshot_observed_at":"2026-08-12T17:05:29.566320Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.566320Z"},"links":{"cited_paper":"/paper/2407.07840","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:c44626094cb66075ae2ebe9590d1beac53122ef353c2bef086863ef59369c972","observation_id":"34d4364f-2f49-40c9-afab-56daad0c10d6","resolution":{"observed_at":"2026-08-12T17:05:29.566320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-13T09:07:54.479155Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-12T17:05:29.568947Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:29.568947Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2411.15201"},"observation_digest":"sha256:d14daafac36a9eb23643dd315e2f1ce0cfdbec14522f403389d56c56733b8596","observation_id":"267bbf16-f600-4915-8948-e7f80b7c6986","resolution":{"observed_at":"2026-08-12T17:05:29.568947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.15201","last_updated":"2024-11-20T01:09:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T07:05:51.372886Z","submitted_at":"2024-11-20T01:09:21Z","title":"Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2411.15201."}