{"as_of":"2026-08-09T13:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea1c35cf687ef1b2b1b4d9248e4ac66c9e7284bb6df5a6d66e9abfefd88e892f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:27:19.300329Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.216469Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-07T14:27:19.300329Z","title":"arXiv preprint arXiv:2407.14500","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:19.300329Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:402832c910e5b86ae8af5b9961d22c5e73c3a0a3e53aabcf43088140f8a91666","observation_id":"59d82159-fd8b-4c8e-b1ef-e006c7f06415","resolution":{"observed_at":"2026-08-07T14:27:19.300329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-07T11:29:29.149297Z","title":"Villa: Unifying vision-language segmentation tasks with large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-09T00:23:41.166151Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.149297Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:d90c09a696a95a932fe761520f8f1310e1c7fda7c134901d344da323a00ab912","observation_id":"51c3e5c4-7511-4120-a3b2-65b765c8c9b2","resolution":{"observed_at":"2026-08-07T11:29:29.149297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-07T00:34:25.104905Z","title":"ViLLa: Video reasoning segmentation with large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:25.104905Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:3ab6ffb4e068de7d0656ef8330c0795a0a886b2da8da115236294d9cf493f2c7","observation_id":"ab1af148-e5f5-45e1-86d7-1042694e9af6","resolution":{"observed_at":"2026-08-07T00:34:25.104905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-06T17:38:20.326601Z","title":"arXiv preprint arXiv:2407.14500 (2024) 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:20.326601Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:fab550208be37e8f4d878b4a0cb99bb456e7ccebd01f71fe02b84c02ebae1282","observation_id":"d69fd75a-9aa7-4bd6-928c-b428aaaf0e05","resolution":{"observed_at":"2026-08-06T17:38:20.326601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-06T16:43:56.438861Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12883","last_updated":"2025-08-13T05:27:53Z","snapshot_observed_at":"2026-08-09T12:18:34.812978Z","submitted_at":"2025-07-17T08:09:31Z","title":"HRSeg: High-Resolution Visual Perception and Enhancement for Reasoning Segmentation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:43:56.438861Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2507.12883"},"observation_digest":"sha256:327c270c7e587231c4d5421c9bb2e6c6d098ef36cfe3039ea9d074c6212a5b36","observation_id":"51c74104-c7d0-4941-bc6f-b74ebc17b510","resolution":{"observed_at":"2026-08-06T16:43:56.438861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-06T11:16:10.460552Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.460552Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:31cfb040ba876d4e91e05a12c1f83cc4ebfc33931b6f374af0d5bcc888d5d00a","observation_id":"f35ef5b4-7b2b-4406-9312-0d74b021a834","resolution":{"observed_at":"2026-08-06T11:16:10.460552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-05T05:09:31.781108Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05751","last_updated":"2025-09-06T15:46:23Z","snapshot_observed_at":"2026-08-07T17:03:08.682303Z","submitted_at":"2025-09-06T15:46:23Z","title":"Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T05:09:31.781108Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2509.05751"},"observation_digest":"sha256:4042cc83a1f16055e9a6b395853e0cb83c3edeaa4c5145ecab7ab718cb12436b","observation_id":"dd204a70-d312-42b5-b8a4-8b8f3464d726","resolution":{"observed_at":"2026-08-05T05:09:31.781108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-08-09T05:10:13.009841Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":239,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:1d4c76ed1c0ef38a4de56ba5a6929152280c8e07d89d06ffb8839be3f5568f1d","observation_id":"b829bba1-a116-4cf6-a6c0-05e336f5e66c","resolution":{"observed_at":"2026-05-11T10:11:08.070769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2604.15670","last_updated":"2026-07-24T04:48:23Z","snapshot_observed_at":"2026-08-02T16:09:56.976755Z","submitted_at":"2026-04-17T03:48:56Z","title":"PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T09:20:54.635375Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.15670"},"observation_digest":"sha256:bbc6df941a2534c639963c085ef3fed5645297e96b9d724ed1dcad51db6e7279","observation_id":"9752265a-1874-4753-a54e-5512d78a2de7","resolution":{"observed_at":"2026-05-10T09:23:37.143330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-02T16:10:02.936737Z","title":"Villa: Video rea- soning segmentation with large language model.CoRR, abs/2407.14500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.15670","last_updated":"2026-07-24T04:48:23Z","snapshot_observed_at":"2026-08-02T16:09:56.976755Z","submitted_at":"2026-04-17T03:48:56Z","title":"PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T16:10:02.936737Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.15670"},"observation_digest":"sha256:5167a39ef55311cd947fa6422b0166655cb8a98ee14ecd2e086f0bc0fdc8de1c","observation_id":"41eec131-2845-444a-84fa-8165ba0eec00","resolution":{"observed_at":"2026-08-02T16:10:02.936737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2604.17797","last_updated":"2026-04-21T05:39:06Z","snapshot_observed_at":"2026-08-02T01:31:40.914610Z","submitted_at":"2026-04-20T04:38:45Z","title":"Weakly-Supervised Referring Video Object Segmentation through Text Supervision","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T05:54:33.227975Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.17797"},"observation_digest":"sha256:a8248da09757ad6197d4f683b43b5d14202515c719417767604745086780bfab","observation_id":"24c37d64-4d13-4d55-bf73-140cbe1b3500","resolution":{"observed_at":"2026-05-10T05:56:11.089619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2604.18665","last_updated":"2026-04-20T14:40:43Z","snapshot_observed_at":"2026-07-06T23:05:30.879164Z","submitted_at":"2026-04-20T14:40:43Z","title":"APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T03:29:12.783993Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.18665"},"observation_digest":"sha256:2dced17109db566fb23d8c0c9a6bc878d0d0f864175358863e76862eb1fc4f0d","observation_id":"88f36ba8-30bd-4fa6-9265-6d15d5212724","resolution":{"observed_at":"2026-05-10T03:29:21.565364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2604.22836","last_updated":"2026-04-20T14:36:19Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-20T14:36:19Z","title":"AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T05:14:25.423302Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2604.22836"},"observation_digest":"sha256:4d3e70ce317962c918d9e3f0f0ad35c8bc662fa77ac106f5fbaa94ea8d70343b","observation_id":"3b99a5eb-097e-40f2-838c-751e1f2a28ae","resolution":{"observed_at":"2026-05-10T09:33:41.857762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2605.07334","last_updated":"2026-05-08T06:39:53Z","snapshot_observed_at":"2026-07-30T14:06:30.177866Z","submitted_at":"2026-05-08T06:39:53Z","title":"RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T01:16:25.031349Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2605.07334"},"observation_digest":"sha256:180308edc39d646d8f410c64b415e95881b2cc19a3266e782e4f0ebf1cb3e7ff","observation_id":"6e2118be-67cd-429d-b53a-d9e35271a891","resolution":{"observed_at":"2026-05-11T04:30:59.882045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2407.14500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-07-04T15:09:55.216469Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"ae3f07f5-23ca-4eee-a141-b69a7460ae36","year":2024},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:948e39687a5c6c42eaa28e5bda242c581a4238e387e13056170d93e1b10b9e64","observation_id":"7c45d39c-2791-40cc-8f92-915504edf8e5","resolution":{"observed_at":"2026-07-04T15:09:55.217966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2407.14500/citation-record","integrity":"/paper/2407.14500/integrity","json":"/paper/2407.14500/citation-record.json","paper":"/paper/2407.14500"},"outbound":[],"paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2407.14500."}