{"as_of":"2026-08-15T05:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9bf77d9641aa312b09496a0acd562ceefed86a60c569ffc96ef80cf113d1de2d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:04:40.726005Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.16365","last_updated":"2025-09-12T17:56:19Z","snapshot_observed_at":"2026-08-07T16:48:30.869743Z","submitted_at":"2025-03-20T17:21:58Z","title":"JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse","version":2},"cited_work":{"arxiv_id":"2503.16365","doi":"10.48550/arxiv.2503.16365","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jarvis-vla: Post-training large- scale vision language models to play visual games with keyboards and mouse","venue":"ArXiv.org","work_id":"bfd23bf3-5908-4890-bb7b-2404a00b0718","year":2025},"citing_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"reference_index":262,"source":"pdf_text","source_observed_at":"2026-05-17T14:08:34.893876Z"},"links":{"cited_paper":"/paper/2503.16365","citing_paper":"/paper/2507.01925"},"observation_digest":"sha256:7d9e0b79f9942f9c5b135199ad0242143e6e4d993d937dc8032aa194b04769e5","observation_id":"d027aadf-72d6-4160-bbc7-99f50ff05e08","resolution":{"observed_at":"2026-05-17T14:08:35.299571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16365","last_updated":"2025-09-12T17:56:19Z","snapshot_observed_at":"2026-08-07T16:48:30.869743Z","submitted_at":"2025-03-20T17:21:58Z","title":"JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16365","snapshot_observed_at":"2026-08-05T23:01:12.517727Z","title":"Jarvis-vla: Post-training large-scale vision language models to play visual games with keyboards and mouse","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06033","last_updated":"2025-08-08T05:38:17Z","snapshot_observed_at":"2026-08-11T21:55:01.957145Z","submitted_at":"2025-08-08T05:38:17Z","title":"InstantEdit: Text-Guided Few-Step Image Editing with Piecewise Rectified Flow","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:01:12.517727Z"},"links":{"cited_paper":"/paper/2503.16365","citing_paper":"/paper/2508.06033"},"observation_digest":"sha256:b69e8506c02ee643e7d83a5422b26ac918f2bbdb6406377305043f8b894a7b22","observation_id":"6e5074be-22d6-4b5e-ab8f-c71c5202bea1","resolution":{"observed_at":"2026-08-05T23:01:12.517727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16365","last_updated":"2025-09-12T17:56:19Z","snapshot_observed_at":"2026-08-07T16:48:30.869743Z","submitted_at":"2025-03-20T17:21:58Z","title":"JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16365","snapshot_observed_at":"2026-08-05T23:04:40.726005Z","title":"Jarvis-vla: Post-training large-scale vision language models to play visual games with keyboards and mouse","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06042","last_updated":"2025-08-08T05:57:12Z","snapshot_observed_at":"2026-08-13T14:57:49.720698Z","submitted_at":"2025-08-08T05:57:12Z","title":"Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T23:04:40.726005Z"},"links":{"cited_paper":"/paper/2503.16365","citing_paper":"/paper/2508.06042"},"observation_digest":"sha256:797c78b0d4e06c0cb33f48d872282d6fed2e856dd8ba96cdfe0af252523dc9f9","observation_id":"abb013ec-6241-4b19-a271-d9093a54621a","resolution":{"observed_at":"2026-08-05T23:04:40.726005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16365","last_updated":"2025-09-12T17:56:19Z","snapshot_observed_at":"2026-08-07T16:48:30.869743Z","submitted_at":"2025-03-20T17:21:58Z","title":"JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse","version":2},"cited_work":{"arxiv_id":"2503.16365","doi":"10.48550/arxiv.2503.16365","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jarvis-vla: Post-training large- scale vision language models to play visual games with keyboards and mouse","venue":"ArXiv.org","work_id":"bfd23bf3-5908-4890-bb7b-2404a00b0718","year":2025},"citing_paper":{"arxiv_id":"2509.02544","last_updated":"2025-09-05T14:59:27Z","snapshot_observed_at":"2026-08-11T12:35:47.937091Z","submitted_at":"2025-09-02T17:44:45Z","title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T10:13:58.774968Z"},"links":{"cited_paper":"/paper/2503.16365","citing_paper":"/paper/2509.02544"},"observation_digest":"sha256:70d3cba49c4bcf40e33dc758f3876a0f443c396c3b1bf21a1ba386b6a8cf9f9f","observation_id":"2eff03f3-e254-4d06-88d9-e3454eef8b1c","resolution":{"observed_at":"2026-05-13T10:13:59.004983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16365","last_updated":"2025-09-12T17:56:19Z","snapshot_observed_at":"2026-08-07T16:48:30.869743Z","submitted_at":"2025-03-20T17:21:58Z","title":"JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse","version":2},"cited_work":{"arxiv_id":"2503.16365","doi":"10.48550/arxiv.2503.16365","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jarvis-vla: Post-training large- scale vision language models to play visual games with keyboards and mouse","venue":"ArXiv.org","work_id":"bfd23bf3-5908-4890-bb7b-2404a00b0718","year":2025},"citing_paper":{"arxiv_id":"2604.07429","last_updated":"2026-04-08T17:49:03Z","snapshot_observed_at":"2026-08-13T21:52:06.857207Z","submitted_at":"2026-04-08T17:49:03Z","title":"GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T17:57:36.038091Z"},"links":{"cited_paper":"/paper/2503.16365","citing_paper":"/paper/2604.07429"},"observation_digest":"sha256:64ae416eadd81f4678d8d8daf2e5e48fcbc4a43ec00ba14c037dc71c86d7809f","observation_id":"4ce6403a-02bc-4462-967f-09a4643747aa","resolution":{"observed_at":"2026-05-11T05:46:08.031769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16365","last_updated":"2025-09-12T17:56:19Z","snapshot_observed_at":"2026-08-07T16:48:30.869743Z","submitted_at":"2025-03-20T17:21:58Z","title":"JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse","version":2},"cited_work":{"arxiv_id":"2503.16365","doi":"10.48550/arxiv.2503.16365","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jarvis-vla: Post-training large- scale vision language models to play visual games with keyboards and mouse","venue":"ArXiv.org","work_id":"bfd23bf3-5908-4890-bb7b-2404a00b0718","year":2025},"citing_paper":{"arxiv_id":"2604.27578","last_updated":"2026-04-30T08:30:25Z","snapshot_observed_at":"2026-08-14T16:47:56.150338Z","submitted_at":"2026-04-30T08:30:25Z","title":"World2Minecraft: Occupancy-Driven Simulated Scenes Construction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T08:01:12.571480Z"},"links":{"cited_paper":"/paper/2503.16365","citing_paper":"/paper/2604.27578"},"observation_digest":"sha256:bed671fa4a9a7ac75025db1390074d746e841f34891343dedb645e0d10cede13","observation_id":"80d67920-a61c-4882-b702-b4cd4cfbe0ff","resolution":{"observed_at":"2026-05-12T10:06:27.350784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16365","last_updated":"2025-09-12T17:56:19Z","snapshot_observed_at":"2026-08-07T16:48:30.869743Z","submitted_at":"2025-03-20T17:21:58Z","title":"JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse","version":2},"cited_work":{"arxiv_id":"2503.16365","doi":"10.48550/arxiv.2503.16365","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jarvis-vla: Post-training large- scale vision language models to play visual games with keyboards and mouse","venue":"ArXiv.org","work_id":"bfd23bf3-5908-4890-bb7b-2404a00b0718","year":2025},"citing_paper":{"arxiv_id":"2605.11223","last_updated":"2026-05-11T20:33:48Z","snapshot_observed_at":"2026-08-15T03:52:50.480894Z","submitted_at":"2026-05-11T20:33:48Z","title":"Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-13T01:58:39.476408Z"},"links":{"cited_paper":"/paper/2503.16365","citing_paper":"/paper/2605.11223"},"observation_digest":"sha256:14b164cb9f2d2627b3e06bd8090cb0d17e0a24e37c83ece68d37da920e33ae93","observation_id":"608bc25b-f1c0-4202-b1d9-9aacf3f88b88","resolution":{"observed_at":"2026-05-13T02:02:05.542043Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16365","last_updated":"2025-09-12T17:56:19Z","snapshot_observed_at":"2026-08-07T16:48:30.869743Z","submitted_at":"2025-03-20T17:21:58Z","title":"JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse","version":2},"cited_work":{"arxiv_id":"2503.16365","doi":"10.48550/arxiv.2503.16365","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jarvis-vla: Post-training large- scale vision language models to play visual games with keyboards and mouse","venue":"ArXiv.org","work_id":"bfd23bf3-5908-4890-bb7b-2404a00b0718","year":2025},"citing_paper":{"arxiv_id":"2605.11223","last_updated":"2026-05-11T20:33:48Z","snapshot_observed_at":"2026-08-15T03:52:50.480894Z","submitted_at":"2026-05-11T20:33:48Z","title":"Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-13T01:58:39.476408Z"},"links":{"cited_paper":"/paper/2503.16365","citing_paper":"/paper/2605.11223"},"observation_digest":"sha256:8b522ddc35662f81cf719df4d07e1e98955c9051bfc1133de135aff7978d7e5f","observation_id":"4ea5cb6b-4c02-4bc8-b4cb-0dc5a16a3bc7","resolution":{"observed_at":"2026-05-13T02:07:08.760783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16365","last_updated":"2025-09-12T17:56:19Z","snapshot_observed_at":"2026-08-07T16:48:30.869743Z","submitted_at":"2025-03-20T17:21:58Z","title":"JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse","version":2},"cited_work":{"arxiv_id":"2503.16365","doi":"10.48550/arxiv.2503.16365","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jarvis-vla: Post-training large- scale vision language models to play visual games with keyboards and mouse","venue":"ArXiv.org","work_id":"bfd23bf3-5908-4890-bb7b-2404a00b0718","year":2025},"citing_paper":{"arxiv_id":"2606.00535","last_updated":"2026-05-30T05:05:24Z","snapshot_observed_at":"2026-08-12T12:43:38.343013Z","submitted_at":"2026-05-30T05:05:24Z","title":"DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T18:55:51.474956Z"},"links":{"cited_paper":"/paper/2503.16365","citing_paper":"/paper/2606.00535"},"observation_digest":"sha256:1d6077cc05a4699e93ecdf44496604006451daf7732dcabab53eec7b3f31c709","observation_id":"d81108ae-4df3-4b7d-a0d3-65b445c56b69","resolution":{"observed_at":"2026-06-28T19:02:34.523053Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.16365/citation-record","integrity":"/paper/2503.16365/integrity","json":"/paper/2503.16365/citation-record.json","paper":"/paper/2503.16365"},"outbound":[],"paper":{"arxiv_id":"2503.16365","last_updated":"2025-09-12T17:56:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T16:48:30.869743Z","submitted_at":"2025-03-20T17:21:58Z","title":"JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2503.16365."}