{"as_of":"2026-08-14T11:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6c7261020a9604048f8ac83b9c149cf63b87c2b4800ce54d7dae6f7fd60898e","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:28:32.039808Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:43:52.925722Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"reference_index":267,"source":"pdf_text","source_observed_at":"2026-05-17T22:16:04.386706Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2408.07666"},"observation_digest":"sha256:defe4ca318bfc52053e3ec1a4f8f7ac52795282bd9c5045ba75e832c414de8a7","observation_id":"76ef0aff-0b87-426a-ba9d-0f3b9bf419c5","resolution":{"observed_at":"2026-05-17T22:16:04.811876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-03T14:16:50.869222Z","title":"Kwai keye-vl 1.5 technical report.arXivpreprintarXiv:2509.01563, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21095","last_updated":"2026-07-11T09:04:48Z","snapshot_observed_at":"2026-08-14T07:02:25.973982Z","submitted_at":"2025-12-24T10:35:21Z","title":"UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T14:16:50.869222Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2512.21095"},"observation_digest":"sha256:2178a622a1e60b7d483e0c4daf6724a2105a3b80a09a032461b21b9d6dc1eb17","observation_id":"55bb90cd-8b5d-4e9f-b10a-f6b3d1cfef1f","resolution":{"observed_at":"2026-08-03T14:16:50.869222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2512.21334","last_updated":"2026-04-10T15:00:46Z","snapshot_observed_at":"2026-08-13T07:44:18.609656Z","submitted_at":"2025-12-24T18:59:36Z","title":"Streaming Video Instruction Tuning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T19:44:11.032898Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2512.21334"},"observation_digest":"sha256:7b957275fbde09a3544e72c7ec4b554bd796e99fe344bbefd66f09388eeca592","observation_id":"f384bfee-91f9-47ca-a7db-8196c89d3bf8","resolution":{"observed_at":"2026-05-16T19:48:21.834586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-05-16T04:21:29.526008Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2601.10611"},"observation_digest":"sha256:91a710eaa01fce71dfb09bdbad79276b49f9ff09776701565e239238ec6629f7","observation_id":"e452badf-0ea2-40e1-ba99-80313943525a","resolution":{"observed_at":"2026-05-16T04:21:29.819348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-03T03:37:50.225051Z","title":"Yao, S., Yu, D., Zhao, J., Shafran, I., Griffiths, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07533","last_updated":"2026-06-26T15:22:02Z","snapshot_observed_at":"2026-08-08T11:16:05.235804Z","submitted_at":"2026-02-07T13:09:41Z","title":"Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:37:50.225051Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2602.07533"},"observation_digest":"sha256:d54f797fcea9c6d3f9ba55391269383bbda1aed53cecd049f682736fec72a1bb","observation_id":"64fa5fcd-4120-429e-9e3b-143122edb5e3","resolution":{"observed_at":"2026-08-03T03:37:50.225051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2604.05015","last_updated":"2026-04-06T17:59:56Z","snapshot_observed_at":"2026-08-11T05:50:34.916262Z","submitted_at":"2026-04-06T17:59:56Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T18:47:32.778695Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2604.05015"},"observation_digest":"sha256:7bcec59965e7f31077b1e7017f15170c0bb3c722a9afddae722153ac14ca2653","observation_id":"6175d828-74e7-46f4-b61b-64de26e54434","resolution":{"observed_at":"2026-05-10T23:55:51.308252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2604.07772","last_updated":"2026-04-09T03:51:14Z","snapshot_observed_at":"2026-07-31T19:42:42.310290Z","submitted_at":"2026-04-09T03:51:14Z","title":"ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T17:55:32.945721Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2604.07772"},"observation_digest":"sha256:d0fe80379c2c81a6efed4248e3740b23d1388d7afbadb0603525247aaf6f715b","observation_id":"b131c060-de44-4390-8e58-9b6d8e67149d","resolution":{"observed_at":"2026-05-11T05:51:03.556398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:0a7b3c17f46d1d3a20b846b4e95e4cbe9886feb41045665b6cb38db1062c6777","observation_id":"3305d732-3469-4c84-8933-0d60cff64d7a","resolution":{"observed_at":"2026-05-11T10:41:04.304928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2604.13029","last_updated":"2026-04-14T17:58:22Z","snapshot_observed_at":"2026-08-12T20:15:17.290437Z","submitted_at":"2026-04-14T17:58:22Z","title":"Visual Preference Optimization with Rubric Rewards","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:45:52.980881Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2604.13029"},"observation_digest":"sha256:5e8ff8ae12c7a452046ad45db94e5dfd7c4e759b587f8cb0b2024bfd1bca0583","observation_id":"fb2752e8-e3f4-4f53-aa8e-34eb48ed1454","resolution":{"observed_at":"2026-05-11T09:56:00.979167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-11T01:00:18.605708Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:550b62e24266ecf6e498c9e5ae73ce823cff94b4ba22c0fb0936cf68276a8c3a","observation_id":"41e5262b-1c59-46c4-a7c8-f586ef0ccd47","resolution":{"observed_at":"2026-05-11T13:46:04.503586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.00444","last_updated":"2026-05-01T06:24:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:24:40Z","title":"Scaling Video Understanding via Compact Latent Multi-Agent Collaboration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T20:11:11.410051Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.00444"},"observation_digest":"sha256:54a293dbdae5caaca7ed9e3d80353f0dffc7fb17d62aa9b5cd3690df9ce7d39a","observation_id":"3e9fdb62-85af-4771-8bce-e8c01f4fac48","resolution":{"observed_at":"2026-05-11T15:21:09.428567Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.09422","last_updated":"2026-05-10T08:48:58Z","snapshot_observed_at":"2026-08-12T00:12:00.146837Z","submitted_at":"2026-05-10T08:48:58Z","title":"Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T03:57:57.791351Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.09422"},"observation_digest":"sha256:287e3f414948ded380ca378db10c6dac15dcc9a24c3a7bb6b073b1095972f1a1","observation_id":"e1be7009-35e8-44c4-8976-5aa3fe49df56","resolution":{"observed_at":"2026-05-12T06:46:52.779669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.10187","last_updated":"2026-05-13T02:10:21Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:38:22Z","title":"SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-12T03:53:46.809307Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.10187"},"observation_digest":"sha256:3083db820ef434b2e96ef53d370ef7a1feeba6f04eed12c984df0663af71a4c8","observation_id":"8e4e4b6a-0863-407c-bf3c-7af9e46783e8","resolution":{"observed_at":"2026-05-12T06:51:28.432591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.10187","last_updated":"2026-05-13T02:10:21Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:38:22Z","title":"SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-14T21:52:08.637283Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.10187"},"observation_digest":"sha256:7e5f9af82c66abe0754daf216f4d97efdc26a937649436e75df45fc17e70bf83","observation_id":"fa9b594c-bbee-4731-b213-66cc62c908f1","resolution":{"observed_at":"2026-05-14T21:53:02.218280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.25364","last_updated":"2026-05-25T02:41:50Z","snapshot_observed_at":"2026-08-04T01:05:16.038519Z","submitted_at":"2026-05-25T02:41:50Z","title":"Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:44:59.860225Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.25364"},"observation_digest":"sha256:38ee9ba1fc91c8aa001fb1c74f0e56911bc21495ec779494c369cf54c445195e","observation_id":"30606730-05cd-4942-b98e-cc2c166a7426","resolution":{"observed_at":"2026-06-29T22:54:01.479148Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.25706","last_updated":"2026-07-04T04:01:13Z","snapshot_observed_at":"2026-08-14T09:53:29.146133Z","submitted_at":"2026-05-25T11:05:37Z","title":"Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T23:15:02.455554Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.25706"},"observation_digest":"sha256:f1916be28d48b7cd1a09845a130fce770227a8a952f484938b1aea149f425b46","observation_id":"4d38d9c6-94fa-423b-aac2-bcab6e55ed0d","resolution":{"observed_at":"2026-06-29T23:24:02.133497Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-08-13T08:54:27.019447Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:320be27e4e1db0f563e201aed221d8233fa68811a9727fd0b61ec46330c7dad1","observation_id":"5b48ea6b-4a0b-444a-a5ff-4f6ef7bdb83c","resolution":{"observed_at":"2026-06-29T22:13:59.514435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.27074","last_updated":"2026-05-26T14:23:25Z","snapshot_observed_at":"2026-08-13T12:04:06.428850Z","submitted_at":"2026-05-26T14:23:25Z","title":"IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T18:24:57.881644Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.27074"},"observation_digest":"sha256:02fe346a84edf1a22a4a88e984331e32f59a34b4429f78bd27677e9afbd27abc","observation_id":"2fda1bbc-b5ac-491f-a4a9-9cf40d4ef74c","resolution":{"observed_at":"2026-06-29T18:33:51.038683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.27365","last_updated":"2026-05-27T02:30:49Z","snapshot_observed_at":"2026-08-14T05:20:08.382449Z","submitted_at":"2026-05-26T17:59:12Z","title":"LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T17:52:59.346637Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.27365"},"observation_digest":"sha256:9995278d63dc329ce2fdc2bc49510c6253e547e925abc5136f66bfe786d4a541","observation_id":"4e4d2b64-a9b1-4fb5-ae5e-bf1688a568fb","resolution":{"observed_at":"2026-06-29T17:53:46.753893Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-08-12T17:34:30.861730Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:d9397a7e097b5316af21a3ad5ad30cba82f982d3b59110000e1faf8971f38034","observation_id":"b2f52786-ada2-4b3a-8b12-92cb7ab9a5ab","resolution":{"observed_at":"2026-07-01T22:56:20.836897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.02569","last_updated":"2026-06-01T17:56:35Z","snapshot_observed_at":"2026-08-14T11:36:56.209518Z","submitted_at":"2026-06-01T17:56:35Z","title":"AdaCodec: A Predictive Visual Code for Video MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T15:20:48.248576Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.02569"},"observation_digest":"sha256:6611c577d57f1273f60bdc693fdc22c1b186cd357c05f12d8ea418e9cd8d0371","observation_id":"32456377-9743-448f-aad7-5c34295d1fde","resolution":{"observed_at":"2026-06-28T15:22:19.505199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":216,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:90f8bc74e6ced2cf9eb558ba1858f10aa44abc38ceebde165389744ed9b41d24","observation_id":"2d3b4783-77b5-4c33-8d97-49711e774cd4","resolution":{"observed_at":"2026-07-02T17:27:15.720322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:b7a80aad7d381ae2921a51aa0f4358080014c72944e487133f8b3ed2e579fff0","observation_id":"9a79df8c-72fd-42e8-8823-f3234311aa4f","resolution":{"observed_at":"2026-07-03T04:27:37.037810Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:9448fa58194565927df7b7aa1c49ffcd1c052d7fdb12e924a1c495411341219d","observation_id":"3520b587-a9e9-4f67-800a-215826e6ea14","resolution":{"observed_at":"2026-07-03T10:48:02.945834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.24602","last_updated":"2026-06-23T14:03:56Z","snapshot_observed_at":"2026-08-13T08:18:10.846007Z","submitted_at":"2026-06-23T14:03:56Z","title":"ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T00:24:20.208132Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.24602"},"observation_digest":"sha256:91afd13b83267eec8e44221807f09ecbad0a7c737143a653db3b0316800b7918","observation_id":"ef9a48c3-39ad-43a9-b2df-7f1179c7e568","resolution":{"observed_at":"2026-07-04T16:39:57.603559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.30026","last_updated":"2026-06-29T09:27:02Z","snapshot_observed_at":"2026-08-05T16:53:44.108925Z","submitted_at":"2026-06-29T09:27:02Z","title":"MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T06:25:38.593423Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.30026"},"observation_digest":"sha256:1a6c7e481fa00e6db8852c16b4bd08bbc0b1450b272cd2449060b28db33dfbe5","observation_id":"e260f3e2-c21d-4845-9da8-2f498738f837","resolution":{"observed_at":"2026-06-30T06:34:19.457791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-07-31T06:20:13.600830Z","title":"Kwai keye-vl 1.5 technical report.arXiv:2509.01563, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-14T07:27:05.336280Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:13.600830Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:140197414fad13b5f7b76ee2be43402a6876474825392d3c7914bf1caadfe1d8","observation_id":"32b845a2-5f39-41b7-b819-87ae2d8710fc","resolution":{"observed_at":"2026-07-31T06:20:13.600830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-07-31T05:08:20.137192Z","title":"Kwai Keye-VL 1.5 technical report.arXiv preprint arXiv:2509.01563, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.137192Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:1005471cd2c976ebd83ea8b0e92d4f08687f7ee9b98743f47971e9cbad9a1140","observation_id":"e7d57d85-9cea-4001-bb59-f7aac00a37b4","resolution":{"observed_at":"2026-07-31T05:08:20.137192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T00:46:40.944996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00536","last_updated":"2026-08-08T09:37:16Z","snapshot_observed_at":"2026-08-13T23:17:34.184754Z","submitted_at":"2026-08-01T08:45:41Z","title":"DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T00:46:40.944996Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2608.00536"},"observation_digest":"sha256:e11540f7c7ec4e7f695cd488247a16c94cbaa0f7ded1b38a134dd8edff1f4143","observation_id":"24489f74-013c-4643-89e9-eff675abf1c1","resolution":{"observed_at":"2026-08-05T00:46:40.944996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-07T00:59:56.101858Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00536","last_updated":"2026-08-08T09:37:16Z","snapshot_observed_at":"2026-08-13T23:17:34.184754Z","submitted_at":"2026-08-01T08:45:41Z","title":"DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:56.101858Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2608.00536"},"observation_digest":"sha256:57bc688114f59e7bde033b1d30ea96716ed91c3d2529569f6314cfc1f1c5b38f","observation_id":"efbfd439-c2f4-4a1b-bc92-e35173578d3f","resolution":{"observed_at":"2026-08-07T00:59:56.101858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-12T20:43:52.925722Z","title":"arXiv:2509.01563 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T11:11:21.278088Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.925722Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:02103bd933f1b80f5e74e5c0ee14ddcd1c540db4f8abcbfc3c34d3aba6e8ca45","observation_id":"0af4d824-63b7-4b5b-8709-ca23b5f8e758","resolution":{"observed_at":"2026-08-12T20:43:52.925722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01563/citation-record","integrity":"/paper/2509.01563/integrity","json":"/paper/2509.01563/citation-record.json","paper":"/paper/2509.01563"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T12:28:24.911132Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:24.911132Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:4a611fd08dd4ff097e5807bfbbd94079e7181fe7b3a557121fff70ac15a0ce8a","observation_id":"96155cd7-0c6c-4024-82aa-e5c64c3c9243","resolution":{"observed_at":"2026-08-05T12:28:24.911132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T12:28:25.288692Z","title":"Ernie 4.5 technical report, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.288692Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:82fe4bd7da94fbc7ea939d5d0fc22b7c42e3a2eb8119020266d3cef0b0dcfc12","observation_id":"54891770-a499-44b3-9f06-783853d26b34","resolution":{"observed_at":"2026-08-05T12:28:25.288692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:25.600786Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.600786Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:1009a3ef2f6fd7c4128cc58eb9228435eff7e265815bf517856ac86f43f90e4b","observation_id":"d0ad010b-53b9-48b2-bc88-156d9c6f71aa","resolution":{"observed_at":"2026-08-05T12:28:25.600786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T12:28:25.798334Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.798334Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:52916d5f9803050ee3f1834054fecdb30516aae45dcf8dbbf3fc999e7def0c34","observation_id":"dd942ec4-2f9a-403f-8681-a1c98494e426","resolution":{"observed_at":"2026-08-05T12:28:25.798334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T12:28:25.940572Z","title":"Mmict: Boosting multi-modal fine-tuning with in-context examples.ACM Transactions on Multimedia Computing, Communications and Applications, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.940572Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:4a57aa99456c5ac1eab0c461977b70fb83c3fa1ca5e4f0043242e120add86cf4","observation_id":"8fb37b12-9d52-4f8e-bb8a-47334319bc4f","resolution":{"observed_at":"2026-08-05T12:28:25.940572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-14T11:06:58.554331Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-05T12:28:26.070670Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.070670Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:f5fe7d2a14169358dac0ff1e2964d418408168897a5ef35da9f75bc58e4c7459","observation_id":"542b9c3b-94ea-4e45-8c62-8379f0fe64b0","resolution":{"observed_at":"2026-08-05T12:28:26.070670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-12T20:39:04.708938Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-05T12:28:26.227633Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.227633Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:c1de79b792339420db4f02d8248598988228d3072c96b08e5dfde5f9c658d3c8","observation_id":"c2adc5cd-ff45-4554-9c9a-f5ecbf6f407d","resolution":{"observed_at":"2026-08-05T12:28:26.227633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07124","last_updated":"2023-10-09T03:34:01Z","snapshot_observed_at":"2026-08-13T10:14:14.963909Z","submitted_at":"2023-09-13T17:59:09Z","title":"RAIN: Your Language Models Can Align Themselves without Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07124","snapshot_observed_at":"2026-08-05T12:28:26.384522Z","title":"Rain: Your language models can align themselves without finetuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.384522Z"},"links":{"cited_paper":"/paper/2309.07124","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:bf114f4d3892758dbecd5f9b50aaf028040d89875e90ea88c99a0d7ce514f378","observation_id":"9af9e927-2ea1-4b3b-b5c2-312c6ead1120","resolution":{"observed_at":"2026-08-05T12:28:26.384522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-13T04:03:01.615934Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-05T12:28:26.680272Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.680272Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:e273839f90c9eed669ecdecdf2bd80a132b6a1bfeb8e9815e4696fd6112f3928","observation_id":"4a4d3bcf-c754-407e-90e5-db416ee141c3","resolution":{"observed_at":"2026-08-05T12:28:26.680272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-12T05:33:56.515699Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-08-05T12:28:26.818295Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.818295Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:1532d18702a7debc4c39ee32886cd8c58136039847ee1144c911976331af16e5","observation_id":"7ca2ec95-3991-4fe6-8abb-0740c4141272","resolution":{"observed_at":"2026-08-05T12:28:26.818295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20502","last_updated":"2025-03-30T03:54:36Z","snapshot_observed_at":"2026-08-12T09:20:55.262813Z","submitted_at":"2025-03-26T12:42:37Z","title":"MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20502","snapshot_observed_at":"2026-08-05T12:28:26.968895Z","title":"Mllm-selector: Necessity and diversity-driven high-value data selection for enhanced visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.968895Z"},"links":{"cited_paper":"/paper/2503.20502","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:86e711968733847b3374aa05082f5d9e77280bf307bbc80cc7ae5491853a69ad","observation_id":"5d978ab4-d259-45df-8b6f-e2b7bfb53809","resolution":{"observed_at":"2026-08-05T12:28:26.968895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-08-05T12:28:27.117812Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:27.117812Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:03c3f8bec265abd29d5faa253b6f4641c12a2f6ff9af9d6f645a2b7bed597b92","observation_id":"87bf0350-663b-4f0c-9efb-884c8ddf2137","resolution":{"observed_at":"2026-08-05T12:28:27.117812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T12:28:27.256289Z","title":"Open- reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:27.256289Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:0876b897e6d05bc987bd97b6bd87f3270f384f9cdde65b47176e2e6750ae67fc","observation_id":"b3f71dca-5c40-40b1-b45d-d5f9da73f9e4","resolution":{"observed_at":"2026-08-05T12:28:27.256289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T12:28:27.379864Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:27.379864Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:b1717195a8302def138041fc11604843e542d503e4e391f292e6a71ecc4aab85","observation_id":"0d1a1c19-d362-4e8a-ad93-90968ce2a127","resolution":{"observed_at":"2026-08-05T12:28:27.379864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:27.513986Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:27.513986Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:4fcb4cb16d078abed2d3829090f6d98c10427e2741a849bf27afbd2a40ca93e9","observation_id":"495ff408-8c7d-4691-8774-7c4a7e2be882","resolution":{"observed_at":"2026-08-05T12:28:27.513986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-05T12:28:27.854438Z","title":"Samir Yitzhak Gadre, Gabriel Ilharco, Alex Fang, Jonathan Hayase, Georgios Smyrnis, Thao Nguyen, Ryan Marten, Mitchell Wortsman, Dhruba Ghosh, Jieyu Zhang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:27.854438Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:4111f25d1ade49bd7058ec38789890bba98f14cd2158fd078844c1d88ef6a364","observation_id":"a12813f4-2c92-43ff-8589-3e99cc7e1263","resolution":{"observed_at":"2026-08-05T12:28:27.854438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23144","last_updated":"2024-10-30T15:59:05Z","snapshot_observed_at":"2026-08-12T22:11:40.811530Z","submitted_at":"2024-10-30T15:59:05Z","title":"Public Domain 12M: A Highly Aesthetic Image-Text Dataset with Novel Governance Mechanisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23144","snapshot_observed_at":"2026-08-05T12:28:28.020884Z","title":"Public domain 12m: A highly aesthetic image-text dataset with novel governance mechanisms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.020884Z"},"links":{"cited_paper":"/paper/2410.23144","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:3f591326bf0a653b5ca9e6b66b06408ccf4de1a11b79ffcf035b8126400cd77a","observation_id":"57b1d7c1-320c-41fe-a077-90b401a1b58d","resolution":{"observed_at":"2026-08-05T12:28:28.020884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:33.632595Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"b2b3c8ca-8e1c-46ad-95ab-f22522c0423f","year":2014},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.159724Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:7ea7f023a39bb2fe7db798f9343c37ea8ead3c5cd4643521bff936288caa51a5","observation_id":"7ba892cb-0d2e-4f90-8022-f7fd4d9b9606","resolution":{"observed_at":"2026-08-05T12:28:33.756086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-10T20:27:34.844428Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T12:28:28.452005Z","title":"Gemini Team, Rohan Anil, Sebastian Borgeaud, Jean-Baptiste Alayrac, Jiahui Yu, Radu Soricut, Johan Schalkwyk, Andrew M Dai, Anja Hauth, Katie Millican, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.452005Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:98393d7ff663f40f19c741ebb8a0aeda6ea391636c9c8c6301ebab145bd6a38c","observation_id":"5672ce2c-f641-4552-ba1f-88334ca51faf","resolution":{"observed_at":"2026-08-05T12:28:28.452005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:33.294062Z","title":"ReferItGame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"8124e0ee-22b9-41cd-8e70-42227232f929","year":2014},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.609733Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:8ae439477317834b0581b264b63bfd171c7c06a7d6c6c6c05efa34df05cfd301","observation_id":"93cc01e1-b660-4105-bb4e-3443d681fd57","resolution":{"observed_at":"2026-08-05T12:28:33.428166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:28.751688Z","title":"doi: 10.3115/v1/D14-1086","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.751688Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:65af888ec2cad5f17f9eae5ee4cf5df867bfb71626d7e7e85b7e58a2328e5243","observation_id":"751aa989-2eba-4ed7-8995-5076ca6ec675","resolution":{"observed_at":"2026-08-05T12:28:28.751688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T12:28:29.027544Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.027544Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:ee4979b1744fd385e28e83384cec4d170d7013a44f5a9ae94453e2dd682a5757","observation_id":"f696242a-dd65-4674-8dfc-64c84568f856","resolution":{"observed_at":"2026-08-05T12:28:29.027544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01583","last_updated":"2025-05-02T21:00:17Z","snapshot_observed_at":"2026-08-07T15:56:56.874332Z","submitted_at":"2025-05-02T21:00:17Z","title":"TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01583","snapshot_observed_at":"2026-08-05T12:28:29.153701Z","title":"Tempura: Temporal event masked prediction and understanding for reasoning in action","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.153701Z"},"links":{"cited_paper":"/paper/2505.01583","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:de12fc43e6cb0edd671f4a1dbf6b35aea2a0212a96bcea6195e85ce897d4f187","observation_id":"80ed4ea1-fdac-4d1f-bec0-38616d15cd1c","resolution":{"observed_at":"2026-08-05T12:28:29.153701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-08T17:49:07.644342Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09925","snapshot_observed_at":"2026-08-05T12:28:29.290584Z","title":"Taskgalaxy: Scaling multi-modal instruction fine-tuning with tens of thousands vision task types","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.290584Z"},"links":{"cited_paper":"/paper/2502.09925","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:4151c629a8567d0a366e0c0cb7784c349ecd79301386c44465bf2f85b83fd9bd","observation_id":"97dacf39-386f-42ba-af0c-d2a9fb255764","resolution":{"observed_at":"2026-08-05T12:28:29.290584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-05T12:28:29.437795Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.437795Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:92a316a7570bce1b659cd476da1f2cccd9180bc44cc347549eacb6c5701be56e","observation_id":"6fde1ffd-faba-4cd4-8962-df6e18b2316f","resolution":{"observed_at":"2026-08-05T12:28:29.437795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:29.577683Z","title":"Chujie Zheng, Shixuan Liu, Mingze Li, Xiong-Hui Chen, Bowen Yu, Chang Gao, Kai Dang, Yuqiong Liu, Rui Men, An Yang, Jingren Zhou, and Junyang Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.577683Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:d4bf467722838e3bc41f137d7f37fbcf2ea3cb1e533d5f2443d2e1c5c742b1ca","observation_id":"e2b8380a-fb52-4083-9e45-b8b32077d12d","resolution":{"observed_at":"2026-08-05T12:28:29.577683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-12T16:05:52.077251Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T12:28:29.805435Z","title":"OpenCompass Contributors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.805435Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:74658ff71840e1451daabe9b94b879495129e4927f091f17a937847c67f48324","observation_id":"31760e6e-13f5-4ec2-b006-15d6d3dab6df","resolution":{"observed_at":"2026-08-05T12:28:29.805435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:33.040609Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"f579c1e4-c345-4b93-b976-9749f201cca7","year":2016},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.019944Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:7f93800a111efd6fc99dfa24057efc93294f4b32c2917f10aba00dd2b3189d6f","observation_id":"eae75902-24bb-42eb-aeec-b53e992d336c","resolution":{"observed_at":"2026-08-05T12:28:33.150695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-14T07:50:44.527247Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-05T12:28:30.182788Z","title":"Zerobench: An impossible visual benchmark for contemporary large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.182788Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:ee09170499e22fa6db7fb998f1069629761ac456afd7ddeda7db055bdeb3cfeb","observation_id":"13a4d9b5-34ab-4d86-b96c-42772aa0706f","resolution":{"observed_at":"2026-08-05T12:28:30.182788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-07T16:00:29.784743Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-08-05T12:28:30.391028Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.391028Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:d71ec210c5b60565c338a40526452a03d5599df3e762cbc22092e2dfd839729c","observation_id":"650cbf96-a3be-4115-b2a4-b1a6341e933c","resolution":{"observed_at":"2026-08-05T12:28:30.391028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13059","last_updated":"2025-02-18T17:04:26Z","snapshot_observed_at":"2026-08-13T05:15:38.857064Z","submitted_at":"2025-02-18T17:04:26Z","title":"SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13059","snapshot_observed_at":"2026-08-05T12:28:30.556672Z","title":"Simplevqa: Multimodal factuality evaluation for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.556672Z"},"links":{"cited_paper":"/paper/2502.13059","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:11ba2e568d3a422d0d7c5282f72dd4900dd8c3396a654da04bc4400022f6233a","observation_id":"50d5d9c7-9092-4a04-8155-352b8c3cffe7","resolution":{"observed_at":"2026-08-05T12:28:30.556672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-05T12:28:30.702457Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.702457Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:d6d0afe7e0ae1f854acfeea2122d10b09325d897d138281118c8b66cbd1bba42","observation_id":"58847d44-65cc-47b0-83c6-4c87767cd765","resolution":{"observed_at":"2026-08-05T12:28:30.702457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T12:28:30.929404Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.929404Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:fb6f65b15f885d049f2f092cfa2825b3f174d060ef7bc6b142cfb6bfe96f52f8","observation_id":"a420801f-3fd4-4250-95f7-555073a1599a","resolution":{"observed_at":"2026-08-05T12:28:30.929404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T12:28:31.083905Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:31.083905Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:da8c6f2bdc3f5d355b47e9f77481cff23dd38efbb2311bb573accb541947baab","observation_id":"d3495f12-f1a7-4bd8-bcb5-7dea6e2e3846","resolution":{"observed_at":"2026-08-05T12:28:31.083905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-08-12T06:11:26.786967Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-05T12:28:31.248879Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:31.248879Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:c4d7580bfb8947e39f31977369a0bcbc6915db0b735162b8ddc7fbb993d90b85","observation_id":"eb1c9eea-f679-4bcb-9227-7c8d10cc2ad9","resolution":{"observed_at":"2026-08-05T12:28:31.248879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-05T12:28:31.473440Z","title":"Logicvista: Multimodal llm logical reasoning benchmark in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:31.473440Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:46227bcff31fc12c3e075d22b40a81e787087c3eefd850f98337e40ee0ba2cbe","observation_id":"f331c613-383a-4f77-8aab-df3e5cebe440","resolution":{"observed_at":"2026-08-05T12:28:31.473440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-08-13T13:19:43.255603Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-05T12:28:31.683925Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:31.683925Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:20cab30338a52ccd003490e981f673c974729efc87556d6a6379747c52c5d6eb","observation_id":"2a76cfdb-d8cb-4be2-b25b-a98ce65010b4","resolution":{"observed_at":"2026-08-05T12:28:31.683925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T12:28:31.824685Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:31.824685Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:982546363a77cd68787151707663c9a9e270351a1c187450e709f7b2cf782381","observation_id":"c366044e-c563-4ae0-bc80-11aa6d5e7e6e","resolution":{"observed_at":"2026-08-05T12:28:31.824685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-14T07:46:43.583789Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-05T12:28:32.039808Z","title":"dad\") lightly bites the little dog’s ear as a way of correcting the little dog’s improper behavior. This gentle bite is a common","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:32.039808Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:9df691844cdf894d601fa1fd0a40227e194058fd063d314b9739f28bf5c2be23","observation_id":"83f477d4-a0ee-4e46-b838-1ef3770b3e50","resolution":{"observed_at":"2026-08-05T12:28:32.039808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11245","last_updated":"2021-02-22T18:30:15Z","snapshot_observed_at":"2026-08-09T15:58:46.603171Z","submitted_at":"2021-02-22T18:30:15Z","title":"Silent Data Corruptions at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.11245","snapshot_observed_at":"2026-08-05T12:28:28.302233Z","title":"Silent data corruptions at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.302233Z"},"links":{"cited_paper":"/paper/2102.11245","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:35dd925e3606c71784351ad7e3c94e683eddd8b52660ea3f541d0f0795bb4be2","observation_id":"67a1da38-4632-40f3-b0b5-40118ad57f57","resolution":{"observed_at":"2026-08-05T12:28:28.302233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","snapshot_observed_at":"2026-08-13T10:03:02.333929Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16511","snapshot_observed_at":"2026-08-05T12:28:28.888144Z","title":"URL https://doi.org/10.1007/ s11263-016-0981-7","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.888144Z"},"links":{"cited_paper":"/paper/2309.16511","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:4de0549c89fbf6f0f26b7933509c6268fe197f41b3d09bbe0d596f8bec0a8269","observation_id":"6f5049e9-a1c7-4e0d-8a87-9c585e5be49e","resolution":{"observed_at":"2026-08-05T12:28:28.888144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T12:28:26.527163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.527163Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:3dec2f95cf3f701aaf78a8a6f2c6c78787b014039300268965e9f812858c66c0","observation_id":"af8abafb-9638-4e7b-b7ad-0ef1fd8de52c","resolution":{"observed_at":"2026-08-05T12:28:26.527163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T12:28:25.063652Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.063652Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:e00ad3130fc4b097b561741653365d5a53bcb02eff68f43f2b1342fb6bc8e52b","observation_id":"f2e98c2b-beef-44a4-a370-49cc3bf06313","resolution":{"observed_at":"2026-08-05T12:28:25.063652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T12:28:25.449452Z","title":"Robobrain 2.0 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.449452Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:1a0dcadda84154db4255844d359d0b694786c3c14b67ce43d27854097e1e94c6","observation_id":"29e69062-42d1-44e4-90bb-5dbe94c70ed8","resolution":{"observed_at":"2026-08-05T12:28:25.449452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 31 inbound Pith citation observations for arXiv:2509.01563."}