{"as_of":"2026-08-09T13:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5410bef8852297cbe790f8abef5c0adcae1960a7bcd8aac13be51db7c19e3e02","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:52.218083Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.026823Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:836c55bc574418797e247b86da2702d1bf929bc4f4e1d53ff674463b3f8c7e83","observation_id":"85eec8d3-62e5-4e27-9f0f-024909f90687","resolution":{"observed_at":"2026-05-15T17:18:53.209391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-08-07T15:42:52.218083Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-07T15:35:48.142895Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.218083Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2505.14231"},"observation_digest":"sha256:faf346f1798d53998781b844beaf475340083af270f17b50fe3b38f9c981f0c5","observation_id":"48ecc93c-134f-4f3b-bb96-9ec944c1ce57","resolution":{"observed_at":"2026-08-07T15:42:52.218083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-08-07T00:13:34.937970Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models.arXiv preprint arXiv:2501.05767, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.937970Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:b027581af43d0c246b9630ebb2ef7c6686165f425bbc7f4c061df1802cbd22c7","observation_id":"2274912a-62dd-498c-9c8a-40ea3cd393f8","resolution":{"observed_at":"2026-08-07T00:13:34.937970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2507.00748","last_updated":"2026-04-12T11:20:16Z","snapshot_observed_at":"2026-08-08T09:01:59.914584Z","submitted_at":"2025-07-01T13:48:57Z","title":"Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T06:50:02.607136Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2507.00748"},"observation_digest":"sha256:a8425e3552171c7280d5560c52ea5efd0581e2263df84305cc796edfab9acfab","observation_id":"9940576a-4182-421d-b421-9bfacf7d6405","resolution":{"observed_at":"2026-05-19T06:52:08.087721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-08-03T18:15:05.561502Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language mod- els.arXiv preprint arXiv:2501.05767, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-08T10:11:06.329717Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.561502Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:fcc54daefd46c42adc4f42b875aee2ed977bef51d0cc0eec61b471669017ca0d","observation_id":"63fd2520-a011-4839-b7eb-25fdabc0b8cb","resolution":{"observed_at":"2026-08-03T18:15:05.561502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2512.08980","last_updated":"2026-04-03T08:53:56Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-05T10:02:38Z","title":"Training Multi-Image Vision Agents via End2End Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T00:59:28.618477Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2512.08980"},"observation_digest":"sha256:0977f6dd6d3dabc72d2ecced1078159c570328f85000e8d77ea214821e2a9316","observation_id":"98d23dba-4d73-42f7-b1e8-54a3b0e3bf51","resolution":{"observed_at":"2026-05-17T01:01:24.328661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2604.22498","last_updated":"2026-04-24T12:26:49Z","snapshot_observed_at":"2026-07-06T23:08:51.913995Z","submitted_at":"2026-04-24T12:26:49Z","title":"CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T12:26:01.568507Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2604.22498"},"observation_digest":"sha256:91d397beaa84e87fd762d7316c38eeca18ea049f5a1fb715e93218e07c33a89f","observation_id":"a417a851-0566-48ec-9742-9f2b06906b2f","resolution":{"observed_at":"2026-05-11T19:16:08.325270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2605.25437","last_updated":"2026-05-25T05:29:07Z","snapshot_observed_at":"2026-08-06T20:41:42.426074Z","submitted_at":"2026-05-25T05:29:07Z","title":"Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:53:55.407461Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2605.25437"},"observation_digest":"sha256:22b10a134c0bedebb9c45f561e33ac3fb5df62212066a20656fabbe1d3a6ad94","observation_id":"2da49c6c-3e9a-4b2f-929b-abefa8092792","resolution":{"observed_at":"2026-06-29T22:54:00.616287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":159,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:a38662d11a4b2bf9c07ada946068ceeba9450a80ee3db1ef9663ce07b868c520","observation_id":"ba7be77d-951f-473d-bd51-a39bc7e96394","resolution":{"observed_at":"2026-07-04T15:09:55.029033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2501.05767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-07-04T15:09:55.026823Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models","venue":null,"work_id":"6d070e82-e925-4587-aa4e-857a42c44453","year":2025},"citing_paper":{"arxiv_id":"2606.26602","last_updated":"2026-06-25T05:02:38Z","snapshot_observed_at":"2026-08-05T11:23:05.305941Z","submitted_at":"2026-06-25T05:02:38Z","title":"DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T05:18:01.931929Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2606.26602"},"observation_digest":"sha256:500b900bd3586f93f99e1367f545925f2ee6e8df074b4b8cb751fdf704999704","observation_id":"9aaaefa8-de82-4fd4-af0d-07d8ec5d2d9a","resolution":{"observed_at":"2026-07-04T13:19:50.963105Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.05767/citation-record","integrity":"/paper/2501.05767/integrity","json":"/paper/2501.05767/citation-record.json","paper":"/paper/2501.05767"},"outbound":[],"paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2501.05767."}