{"as_of":"2026-08-14T09:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2fb3c52f1bf6b3f35baf6b11955bb9c5d278f2cb4c8933d74cfe08b17acd18d0","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:18:59.503626Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T20:34:35.048469Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T04:08:59.885995Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"cited_work":{"arxiv_id":"2506.05856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05856","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view multi-modal segmentation@ ego- exo4d challenges 2025.arXiv preprint arXiv:2506.05856","venue":null,"work_id":"a73a0308-39f0-486e-bc57-ab68373315e7","year":2025},"citing_paper":{"arxiv_id":"2511.20886","last_updated":"2026-04-08T06:35:31Z","snapshot_observed_at":"2026-08-11T02:05:36.893465Z","submitted_at":"2025-11-25T22:06:30Z","title":"V$^{2}$-SAM: Marrying SAM2 with Multi-Prompt Experts for Cross-View Object Correspondence","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T04:08:32.413555Z"},"links":{"cited_paper":"/paper/2506.05856","citing_paper":"/paper/2511.20886"},"observation_digest":"sha256:46cef73f6fcb1e18cfdb48a10a7d8c26b5a0e1d648454d992d8109e067fd49e9","observation_id":"45f5f125-8168-42f0-a724-759311ab1d31","resolution":{"observed_at":"2026-05-17T04:08:59.888437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"cited_work":{"arxiv_id":"2506.05856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05856","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view multi-modal segmentation@ ego- exo4d challenges 2025.arXiv preprint arXiv:2506.05856","venue":null,"work_id":"a73a0308-39f0-486e-bc57-ab68373315e7","year":2025},"citing_paper":{"arxiv_id":"2602.14122","last_updated":"2026-04-18T15:08:17Z","snapshot_observed_at":"2026-08-13T15:03:26.321098Z","submitted_at":"2026-02-15T12:46:35Z","title":"EgoSound: Benchmarking Sound Understanding in Egocentric Videos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T21:44:47.636912Z"},"links":{"cited_paper":"/paper/2506.05856","citing_paper":"/paper/2602.14122"},"observation_digest":"sha256:4a6e314532478f9023e6e2db0028100190fab92b833798f71f95fc35c272a59a","observation_id":"378ac56e-6c33-4603-adf4-bd3f9b767014","resolution":{"observed_at":"2026-05-15T21:46:42.453337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"cited_work":{"arxiv_id":"2506.05856","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05856","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view multi-modal segmentation@ ego- exo4d challenges 2025.arXiv preprint arXiv:2506.05856","venue":null,"work_id":"a73a0308-39f0-486e-bc57-ab68373315e7","year":2025},"citing_paper":{"arxiv_id":"2604.13793","last_updated":"2026-07-01T12:10:20Z","snapshot_observed_at":"2026-08-13T13:28:39.975215Z","submitted_at":"2026-04-15T12:32:25Z","title":"From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:35.738229Z"},"links":{"cited_paper":"/paper/2506.05856","citing_paper":"/paper/2604.13793"},"observation_digest":"sha256:7a1311ef70b0fddf16ecd201fd78999d303b14466dc1bbbe4e7dcbef27978297","observation_id":"e1f06317-7c39-4021-8e94-02a06f54a6ca","resolution":{"observed_at":"2026-05-10T13:25:26.135752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05856","snapshot_observed_at":"2026-07-12T20:34:35.048469Z","title":"arXiv preprint arXiv:2506.05856 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.13793","last_updated":"2026-07-01T12:10:20Z","snapshot_observed_at":"2026-08-13T13:28:39.975215Z","submitted_at":"2026-04-15T12:32:25Z","title":"From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T20:34:35.048469Z"},"links":{"cited_paper":"/paper/2506.05856","citing_paper":"/paper/2604.13793"},"observation_digest":"sha256:81d10730a7f25c8affaf6f99bd29c7a861ff6a92e96729cb15c8fee04865e5fb","observation_id":"bead3897-5736-46bc-bd36-2ff7e272972b","resolution":{"observed_at":"2026-07-12T20:34:35.048469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05856/citation-record","integrity":"/paper/2506.05856/integrity","json":"/paper/2506.05856/citation-record.json","paper":"/paper/2506.05856"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.08020","last_updated":"2023-09-14T20:31:06Z","snapshot_observed_at":"2026-08-13T10:13:21.476804Z","submitted_at":"2023-09-14T20:31:06Z","title":"Temporal-aware Hierarchical Mask Classification for Video Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08020","snapshot_observed_at":"2026-08-07T10:18:56.249004Z","title":"Temporal-aware hierarchical mask classi- fication for video semantic segmentation.arXiv preprint arXiv:2309.08020, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:56.249004Z"},"links":{"cited_paper":"/paper/2309.08020","citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:1d1a0b5e05a1f8545ac964ccf9582ebe19c5d55850b9ceaefa6412d828eb3b28","observation_id":"2f443e88-6f5d-4d08-ad89-862e47251202","resolution":{"observed_at":"2026-08-07T10:18:56.249004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:04.304500Z","title":"Cafuser: Condition-aware multimodal fusion for robust semantic perception of driving scenes.IEEE Robotics and Automation Letters, 2025","venue":null,"work_id":"497a754c-fd33-41ee-b9d7-07108396db51","year":2025},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:56.403870Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:5284723c7997188dca095a36f6cfc3d2519f0aa85c04e21dba8e19cc29b3a500","observation_id":"725b2662-33f0-4a09-a40b-44a60a7ca21b","resolution":{"observed_at":"2026-08-07T10:19:04.443359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:56.608701Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:56.608701Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:3a0dc2fb873b3d0c4260be2bf9c2206853bd081eb303254ac2c14aa28cf37773","observation_id":"005689ea-7fa6-4dd9-a440-cf2077ddbf35","resolution":{"observed_at":"2026-08-07T10:18:56.608701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19083","last_updated":"2025-07-25T17:11:59Z","snapshot_observed_at":"2026-08-14T08:23:03.138137Z","submitted_at":"2024-11-28T12:01:03Z","title":"ObjectRelator: Enabling Cross-View Object Relation Understanding Across Ego-Centric and Exo-Centric Perspectives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19083","snapshot_observed_at":"2026-08-07T10:18:56.887838Z","title":"Objectrelator: Enabling cross-view object relation understanding in ego-centric and exo-centric videos.arXiv preprint arXiv:2411.19083, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:56.887838Z"},"links":{"cited_paper":"/paper/2411.19083","citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:368aa9411bfe9e7a5afbcfd520869acb8968e727063d59bf0d4ec5da9ba1d276","observation_id":"9a9bd9f0-db89-474f-9dbb-3059afafdf53","resolution":{"observed_at":"2026-08-07T10:18:56.887838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:03.930016Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":"00d10b4a-135c-4fee-938e-842e03078e23","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.082792Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:0bab1b7ae01c18636bffc9e718e224729ad60bc74c147fc99211fc38cfcc2836","observation_id":"e9ede233-0518-4a9b-adb7-71326dc6b4df","resolution":{"observed_at":"2026-08-07T10:19:04.082575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:03.577164Z","title":"X-prompt: Multi-modal visual prompt for video object segmentation","venue":null,"work_id":"f36a44a1-2b03-483c-9f76-9e62369093cb","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.211327Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:4f07a4053855c3546e853c70ee9be7b0d35fcc33987345a7baa2884f54e263b3","observation_id":"dcc6bcdd-1821-4e1d-bdbc-b6f208832efe","resolution":{"observed_at":"2026-08-07T10:19:03.750415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.352999Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.352999Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:852986d31310f933313d7dbb30735b4483829702fc4252154f22b10cefb9496e","observation_id":"2248e8af-93c6-461e-8043-9a5845b92469","resolution":{"observed_at":"2026-08-07T10:18:57.352999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:03.217808Z","title":"Segment any- thing","venue":null,"work_id":"70b33c79-60d0-4d7d-ab85-8d4b7674fa0d","year":2023},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.574611Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:982f852bff0d42df577fb4428be5dbf7559e540c136efe5de83c5ba652fdfdd5","observation_id":"8c715af6-5be4-49c1-9adf-03527e671253","resolution":{"observed_at":"2026-08-07T10:19:03.388111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.715692Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.715692Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:80aae3480d9c36bdd2c031ebbe9180b05a7fa51610cc5c5a22d9f53ee3b3123c","observation_id":"1eec0d54-d72c-48c0-9cef-dd27f930a10e","resolution":{"observed_at":"2026-08-07T10:18:57.715692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:02.930645Z","title":"Onevos: unifying video object segmentation with all-in-one transformer framework","venue":null,"work_id":"ee60dbc7-adf8-43cf-9485-3298d815828a","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:57.915378Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:a8567fdf4bd72d2873b6564fb63e28c4fcb00171e6bafb5fa0f748670037246d","observation_id":"dffa37fb-3d66-4632-aa6e-62a3288a89c9","resolution":{"observed_at":"2026-08-07T10:19:03.076345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:02.470444Z","title":"Omg-seg: Is one model good enough for all segmentation? InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 27948–27959, 2024","venue":null,"work_id":"300c7bea-6cbf-4967-aed6-f7cf44546cb3","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.062171Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:40e32676b6dfac1b10e2a2e22557c9e12f2d6a96ebbb69bb2426023731eb9cc8","observation_id":"bb2f6463-df76-41e6-a09a-21e7517ed54e","resolution":{"observed_at":"2026-08-07T10:19:02.653871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:02.076362Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"b19c7f0a-4d67-4f42-a274-ec20e76a347a","year":2023},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.185928Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:99a1aedd1aa4d4716cb13564bd7ad4fd3983ca57cc027028a8281a77eec10192","observation_id":"b17b2a62-90ab-4414-8a7e-aeedd7231407","resolution":{"observed_at":"2026-08-07T10:19:02.276457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:01.801427Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"d69e1d87-af76-43ac-a777-060b2cf049f8","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.377127Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:860cd0d8d78e3210217c071e0dfaf183ec2fad1dc43f05a1e148d3b00517fb2e","observation_id":"8f8f8368-3aaf-454a-9730-17e3c90ee25b","resolution":{"observed_at":"2026-08-07T10:19:01.929591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:58.523241Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.523241Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:e14034605596af276a757e94de21b9b1aa71d4da019cf60845578fda04c842bb","observation_id":"c39d921c-cc6a-44fd-9681-6a09baecdfa2","resolution":{"observed_at":"2026-08-07T10:18:58.523241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:01.380082Z","title":"Object segmentation by mining cross-modal se- mantics","venue":null,"work_id":"c84022eb-dd6e-40b7-8153-20e3db33d95f","year":2023},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.644474Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:c44e7efb2eaca41b0a1834bf8768513465e410db88e8bfea04b1572ca2e6a492","observation_id":"dd7159c9-5b50-43aa-8975-22f8c1e711db","resolution":{"observed_at":"2026-08-07T10:19:01.625200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:01.018556Z","title":"Universal instance percep- tion as object discovery and retrieval","venue":null,"work_id":"ad9ced3f-0c36-47b8-8986-2727c5008755","year":2023},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.788169Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:05d18fa5da123a9488d72a5de22c0a3a688f931d4a9c091720c54325469dd6a0","observation_id":"c747ee1b-86f7-4769-86c8-34b97e4cbe48","resolution":{"observed_at":"2026-08-07T10:19:01.197110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:00.759431Z","title":"Psalm: Pixelwise segmentation with large multi-modal model","venue":null,"work_id":"93ce8fea-5967-473d-8c7a-a0bd29a2639a","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.981985Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:83bde07059160f89b4463070140d3787622425a81bad06181bd2727fd5a2ec41","observation_id":"759a649d-20e8-4891-9aef-ac73f5c4a62c","resolution":{"observed_at":"2026-08-07T10:19:00.878470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:00.495729Z","title":"Learning modality-agnostic representation for semantic segmentation from any modalities","venue":null,"work_id":"51710b0e-af90-4ceb-9d5c-0c0e83299671","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.093530Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:d40d59fdc717c1c96fedd98325ce7fc701e2cae2e2211f0ec3bf2f42483be354","observation_id":"19814800-e546-41d5-9444-5c9be91d9830","resolution":{"observed_at":"2026-08-07T10:19:00.648495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:00.178104Z","title":"Distilling efficient vision transformers from cnns for seman- tic segmentation.Pattern Recognition, 158:111029, 2025","venue":null,"work_id":"1b039095-f4d6-49bd-8d0e-3bae0be60634","year":2025},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.200838Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:205da585190fc1aa6de33ba51a6b85f75f7cf3609e9cd8856445a819530449f7","observation_id":"4410f5b4-1a5e-42e0-a987-d38127f4db51","resolution":{"observed_at":"2026-08-07T10:19:00.321486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:59.275393Z","title":"Camsam2: Segment any- thing accurately in camouflaged videos.arXiv preprint arXiv:2503.19730, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.275393Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:3846a07fa210dccd9963b63c110fc9e225b5eaa92e862de32b9eee49ffb91944","observation_id":"78db28db-7858-4696-b071-c70b71236434","resolution":{"observed_at":"2026-08-07T10:18:59.275393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:59.840876Z","title":"Segment everything everywhere all at once.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"fa70277b-d9a9-44c7-be7b-fa4325ed443e","year":2024},"citing_paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.503626Z"},"links":{"citing_paper":"/paper/2506.05856"},"observation_digest":"sha256:6c32d45dcb11279204df42d168bd84b6ac95de173e176d9ea1da8333500a8084","observation_id":"c941f7fe-cc7c-4db7-95a0-8ab2d87d253f","resolution":{"observed_at":"2026-08-07T10:19:00.032209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05856","last_updated":"2025-06-06T08:23:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T03:31:32.817980Z","submitted_at":"2025-06-06T08:23:39Z","title":"Cross-View Multi-Modal Segmentation @ Ego-Exo4D Challenges 2025"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 4 inbound Pith citation observations for arXiv:2506.05856."}