{"as_of":"2026-08-14T18:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:784747f3d16ddfecf5d4fc7f800ca60f51f3e6f775dcfb5a967f3b39ea9ed862","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:45:09.544304Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:37.045836Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","snapshot_observed_at":"2026-08-13T10:03:02.333929Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":"2309.16511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16511","snapshot_observed_at":"2026-07-03T04:27:37.045836Z","title":"Toloka vi- sual question answering benchmark","venue":null,"work_id":"39c3ddb8-0ceb-4000-9866-202b6f278b42","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2309.16511","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:9790a8fcb4ef32bf55ec4e3d00c3c2a900e09659008a78e77b889a0515b943b5","observation_id":"7c1c380f-0300-4df3-afbc-ff746b9e25fa","resolution":{"observed_at":"2026-05-13T22:46:10.144043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","snapshot_observed_at":"2026-08-13T10:03:02.333929Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":"2309.16511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16511","snapshot_observed_at":"2026-07-03T04:27:37.045836Z","title":"Toloka vi- sual question answering benchmark","venue":null,"work_id":"39c3ddb8-0ceb-4000-9866-202b6f278b42","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":237,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2309.16511","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:726d99fe549bf84e2c02d13ebc0bbe592ebf317fbae1ee8497785daba9a9a20d","observation_id":"c78abae7-7e2d-4e6e-94a9-7b83527de4b4","resolution":{"observed_at":"2026-05-10T13:23:58.070934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","snapshot_observed_at":"2026-08-13T10:03:02.333929Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16511","snapshot_observed_at":"2026-08-06T20:45:09.544304Z","title":"Toloka visual question answering benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-13T03:34:39.503239Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.544304Z"},"links":{"cited_paper":"/paper/2309.16511","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:cae9f6f5c51dcd684c6d14486eb16ef95b9afd3dc2698c795d19eda4604f72a8","observation_id":"d3b30d42-d9b3-4dd6-9872-dddba4b0effe","resolution":{"observed_at":"2026-08-06T20:45:09.544304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","snapshot_observed_at":"2026-08-13T10:03:02.333929Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16511","snapshot_observed_at":"2026-08-05T12:28:28.888144Z","title":"URL https://doi.org/10.1007/ s11263-016-0981-7","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.888144Z"},"links":{"cited_paper":"/paper/2309.16511","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:4de0549c89fbf6f0f26b7933509c6268fe197f41b3d09bbe0d596f8bec0a8269","observation_id":"6f5049e9-a1c7-4e0d-8a87-9c585e5be49e","resolution":{"observed_at":"2026-08-05T12:28:28.888144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","snapshot_observed_at":"2026-08-13T10:03:02.333929Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16511","snapshot_observed_at":"2026-08-04T11:31:15.618220Z","title":"Toloka visual question answering benchmark,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04349","last_updated":"2025-10-05T20:18:34Z","snapshot_observed_at":"2026-08-14T05:39:15.595336Z","submitted_at":"2025-10-05T20:18:34Z","title":"Challenge on Optimization of Context Collection for Code Completion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T11:31:15.618220Z"},"links":{"cited_paper":"/paper/2309.16511","citing_paper":"/paper/2510.04349"},"observation_digest":"sha256:198e13ca0ef3e5b51e44251d6a31e42dc6c84c8d6e3775eb4849c0d697c8f1de","observation_id":"984d8992-c238-442b-9cf3-945890a1e413","resolution":{"observed_at":"2026-08-04T11:31:15.618220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","snapshot_observed_at":"2026-08-13T10:03:02.333929Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":"2309.16511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16511","snapshot_observed_at":"2026-07-03T04:27:37.045836Z","title":"Toloka vi- sual question answering benchmark","venue":null,"work_id":"39c3ddb8-0ceb-4000-9866-202b6f278b42","year":2023},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2309.16511","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:a6b05ca3dac142068dd5f6eb504e655a66b65bfe8a88732e07f299948cd9f9d2","observation_id":"f7f79897-0466-4e59-ae37-649f52a31f16","resolution":{"observed_at":"2026-07-03T04:27:37.047200Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","snapshot_observed_at":"2026-08-13T10:03:02.333929Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":"2309.16511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16511","snapshot_observed_at":"2026-07-03T04:27:37.045836Z","title":"Toloka vi- sual question answering benchmark","venue":null,"work_id":"39c3ddb8-0ceb-4000-9866-202b6f278b42","year":2023},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-08-10T01:17:41Z","snapshot_observed_at":"2026-08-13T23:28:37.542175Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":289,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2309.16511","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:0a5f9d5a55d5a1102f8c19a253f70db8a4dd54c7ca68496af8c937fa544e371e","observation_id":"676d7a69-1ffa-45f8-b734-1f7fb49d254c","resolution":{"observed_at":"2026-07-01T15:35:48.899939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","snapshot_observed_at":"2026-08-13T10:03:02.333929Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":"2309.16511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16511","snapshot_observed_at":"2026-07-03T04:27:37.045836Z","title":"Toloka vi- sual question answering benchmark","venue":null,"work_id":"39c3ddb8-0ceb-4000-9866-202b6f278b42","year":2023},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-08-10T01:17:41Z","snapshot_observed_at":"2026-08-13T23:28:37.542175Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":289,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2309.16511","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:a71afd77a730bfc18cc0ad9fdbb8e8a1c2e643145ffb2405eddae22fd553d5b3","observation_id":"4caf2b4b-693e-452c-ac4e-b2a4f7b03c8b","resolution":{"observed_at":"2026-07-02T21:17:24.068563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2309.16511/citation-record","integrity":"/paper/2309.16511/integrity","json":"/paper/2309.16511/citation-record.json","paper":"/paper/2309.16511"},"outbound":[],"paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:03:02.333929Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2309.16511."}