{"as_of":"2026-08-17T04:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a82a28797a4a4428f50fc95f66a2ee8c4486c68e0eb0a172647ea0ebd9ab04ea","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:46:49.011495Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T19:15:01.025528Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":"2311.00571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-06-30T19:15:01.025528Z","title":"Llava-interactive: An all-in-one demo for image chat, segmentation, generation and editing","venue":null,"work_id":"ee203f06-0b4c-421f-9987-6eb05c5d329c","year":2023},"citing_paper":{"arxiv_id":"2410.21169","last_updated":"2026-04-04T17:04:02Z","snapshot_observed_at":"2026-08-15T04:34:24.922843Z","submitted_at":"2024-10-28T16:11:35Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:21.695801Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2410.21169"},"observation_digest":"sha256:1bdfe57e0ff0b593b0d6505eadf889e4b4cc1fcb2b6493a279b7cd2bd0c31272","observation_id":"eb25dc0a-a158-4f21-ae37-4cfd71f0dcb7","resolution":{"observed_at":"2026-05-23T19:15:47.116632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-08-12T10:44:14.694941Z","title":"Llava-interactive: An all-in-one demo for image chat, segmentation, generation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18983","last_updated":"2024-11-28T08:07:32Z","snapshot_observed_at":"2026-08-16T12:05:07.284509Z","submitted_at":"2024-11-28T08:07:32Z","title":"SPAgent: Adaptive Task Decomposition and Model Selection for General Video Generation and Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:44:14.694941Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2411.18983"},"observation_digest":"sha256:e91920fa9cbfaf5ab271b077c8aead6f05a9f8897380ac1456d48005ff0f73c3","observation_id":"ba40203d-e31d-4495-a19d-ccfea8043e4f","resolution":{"observed_at":"2026-08-12T10:44:14.694941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":"2311.00571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-06-30T19:15:01.025528Z","title":"Llava-interactive: An all-in-one demo for image chat, segmentation, generation and editing","venue":null,"work_id":"ee203f06-0b4c-421f-9987-6eb05c5d329c","year":2023},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-16T10:23:40.545862Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:8d0615922ebd110e4a8d1158e0a13498be56ce710543549733b6ffa28ffc7127","observation_id":"66c596f8-bef6-47a7-92f4-f7f6df5ca87c","resolution":{"observed_at":"2026-05-16T11:39:22.536662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-08-10T18:53:21.142546Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10967","last_updated":"2025-02-12T08:10:06Z","snapshot_observed_at":"2026-08-13T22:41:42.954852Z","submitted_at":"2025-01-19T07:00:46Z","title":"Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T18:53:21.142546Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2501.10967"},"observation_digest":"sha256:a59243036431d873785417ffdd3209b9bb21d958a9b823647f3489a8aacabbd9","observation_id":"1b14393b-8007-46ad-8a5f-cb8277c9670f","resolution":{"observed_at":"2026-08-10T18:53:21.142546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-08-16T05:46:49.011495Z","title":"arXiv preprint arXiv:2311.00571","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19847","last_updated":"2025-04-28T14:45:26Z","snapshot_observed_at":"2026-08-17T02:24:32.590652Z","submitted_at":"2025-04-28T14:45:26Z","title":"Foundation Model-Driven Framework for Human-Object Interaction Prediction with Segmentation Mask Integration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:46:49.011495Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2504.19847"},"observation_digest":"sha256:eafe5b81e215d76f21a5ae1baa019cb3fbc34ca5cc9b5815d83f4247f828ae9a","observation_id":"7f851866-9bdf-43f3-a7f7-00b6dc322be3","resolution":{"observed_at":"2026-08-16T05:46:49.011495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-08-16T00:49:40.189040Z","title":"Llava-interactive: An all-in-one demo for image chat, segmentation, generation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02648","last_updated":"2025-05-06T15:18:25Z","snapshot_observed_at":"2026-08-17T04:30:00.704253Z","submitted_at":"2025-05-05T13:50:03Z","title":"MCCD: Multi-Agent Collaboration-based Compositional Diffusion for Complex Text-to-Image Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:49:40.189040Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2505.02648"},"observation_digest":"sha256:58f9d19c43849215a93810d40b9ed9b1e6957a57cb46c33b8baea9c7edc3aac1","observation_id":"5297fe55-ba3d-404c-868d-b4dcd4b96b06","resolution":{"observed_at":"2026-08-16T00:49:40.189040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-08-07T05:26:58.939069Z","title":"Llava-interactive: An all-in-one demo for image chat, segmentation, generation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08005","last_updated":"2025-06-09T17:59:51Z","snapshot_observed_at":"2026-08-14T11:20:52.565431Z","submitted_at":"2025-06-09T17:59:51Z","title":"ZeroVO: Visual Odometry with Minimal Assumptions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:58.939069Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2506.08005"},"observation_digest":"sha256:318646ec2eb54887b70a6caf98b13ca275389ff73e2f659da77a5ce5e9ba294d","observation_id":"f4d3b2e0-f4c1-4ec3-9c84-aefc544a0028","resolution":{"observed_at":"2026-08-07T05:26:58.939069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":"2311.00571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-06-30T19:15:01.025528Z","title":"Llava-interactive: An all-in-one demo for image chat, segmentation, generation and editing","venue":null,"work_id":"ee203f06-0b4c-421f-9987-6eb05c5d329c","year":2023},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-08-12T14:43:37.008792Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T00:12:39.834892Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:6097ec2d0e74ce9a01ee3f555624c2555bff849a64bd77e14f980fa3d6d53d26","observation_id":"3110745d-1193-4f13-a9bd-f888d9d002cd","resolution":{"observed_at":"2026-05-19T00:12:54.027421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":"2311.00571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-06-30T19:15:01.025528Z","title":"Llava-interactive: An all-in-one demo for image chat, segmentation, generation and editing","venue":null,"work_id":"ee203f06-0b4c-421f-9987-6eb05c5d329c","year":2023},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-08-12T14:43:37.008792Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-25T08:02:15.950975Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:996c8ce0190d5c75fe976c4e61a8024ec27186c96d303ccb4c779221ef75a1fd","observation_id":"49da9031-fc32-4f2b-a3b2-c10b26e3ddb5","resolution":{"observed_at":"2026-05-25T08:05:30.658939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-08-05T20:29:09.987685Z","title":"Chen et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-13T23:10:52.614750Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":273,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:09.987685Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:695f8ecb39b4cb632db43e9a76fad0f1f4f9ec70283497e6d4c96fa663dd918f","observation_id":"0fbf6a59-969d-4688-8b4e-5a562fb3d538","resolution":{"observed_at":"2026-08-05T20:29:09.987685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-08-05T15:29:25.367304Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19852","last_updated":"2025-08-28T07:08:03Z","snapshot_observed_at":"2026-08-13T08:30:59.513568Z","submitted_at":"2025-08-27T13:09:55Z","title":"Ego-centric Predictive Model Conditioned on Hand Trajectories","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T15:29:25.367304Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2508.19852"},"observation_digest":"sha256:98fddb4f0913ec7f5c1558eb2a8e37a0a5a4cf2dece90f110ae3f3caaca3458f","observation_id":"79d84097-cb4d-4ab8-b0a8-74a8551b01ba","resolution":{"observed_at":"2026-08-05T15:29:25.367304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":"2311.00571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-06-30T19:15:01.025528Z","title":"Llava-interactive: An all-in-one demo for image chat, segmentation, generation and editing","venue":null,"work_id":"ee203f06-0b4c-421f-9987-6eb05c5d329c","year":2023},"citing_paper":{"arxiv_id":"2605.09024","last_updated":"2026-05-09T16:04:06Z","snapshot_observed_at":"2026-08-13T02:57:07.501118Z","submitted_at":"2026-05-09T16:04:06Z","title":"Relightable Gaussian Splatting for Virtual Production Using Image-Based Illumination","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-12T01:56:34.807815Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2605.09024"},"observation_digest":"sha256:ea473d6cacabc6a92b304b0c71e67008b74a10f9c03b36e68253e9c4b0aa6eb8","observation_id":"90508fbc-5b49-4985-b156-1603ded0066c","resolution":{"observed_at":"2026-05-12T07:46:35.198556Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":"2311.00571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-06-30T19:15:01.025528Z","title":"Llava-interactive: An all-in-one demo for image chat, segmentation, generation and editing","venue":null,"work_id":"ee203f06-0b4c-421f-9987-6eb05c5d329c","year":2023},"citing_paper":{"arxiv_id":"2605.17531","last_updated":"2026-05-24T12:33:07Z","snapshot_observed_at":"2026-08-16T13:54:21.040132Z","submitted_at":"2026-05-17T16:30:44Z","title":"Don't Guess, Just Ask: Resolving Ambiguity in Referring Segmentation via Multi-turn Clarification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T13:38:21.492236Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2605.17531"},"observation_digest":"sha256:8a5c2dda928ae90fae24db6c21d9d360b999dc2fd7bd4509726708d03d931622","observation_id":"fefe5fc2-e163-4c81-9296-2c7661de7aef","resolution":{"observed_at":"2026-05-20T13:43:19.800281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":"2311.00571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-06-30T19:15:01.025528Z","title":"Llava-interactive: An all-in-one demo for image chat, segmentation, generation and editing","venue":null,"work_id":"ee203f06-0b4c-421f-9987-6eb05c5d329c","year":2023},"citing_paper":{"arxiv_id":"2605.17531","last_updated":"2026-05-24T12:33:07Z","snapshot_observed_at":"2026-08-16T13:54:21.040132Z","submitted_at":"2026-05-17T16:30:44Z","title":"Don't Guess, Just Ask: Resolving Ambiguity in Referring Segmentation via Multi-turn Clarification","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T19:07:05.208780Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2605.17531"},"observation_digest":"sha256:9f83dce84bf55506974c80b6f82dd4ce9a334a3b5e3f73e89cfe0918e89af5f5","observation_id":"c7e300d8-00ce-458c-96fc-2b98f9977063","resolution":{"observed_at":"2026-06-30T19:15:01.027802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Llava- interactive: An all-in-one demo for image chat, segmentation, generation and editing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-13T12:07:25.625234Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:362d7b4f71a3cc97f524feb3961fce63340b6ba3be5b23636a7040185dc2df1f","observation_id":"9d9f1967-9619-4e5d-b923-c34257ae8a5a","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.00571/citation-record","integrity":"/paper/2311.00571/integrity","json":"/paper/2311.00571/citation-record.json","paper":"/paper/2311.00571"},"outbound":[],"paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:46:51.110409Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2311.00571."}