{"as_of":"2026-08-23T04:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc9ffe062aaa81225b27b052c7bd95e989cf709d175d1a763d63a1ebf1905fa8","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:08:16.171841Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22061/citation-record","integrity":"/paper/2507.22061/integrity","json":"/paper/2507.22061/citation-record.json","paper":"/paper/2507.22061"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.910219Z","title":"Learning what to learn for video object segmentation","venue":null,"work_id":"12f9474c-2c00-4911-a680-de75fe69f88e","year":2020},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.009383Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:2e0c75cb8f47c26ef806b1979f2740679981c43cec49e3ac4ebb1b7b3912dca5","observation_id":"2d5e26ee-0ce2-423d-ba21-92bc87ea57ac","resolution":{"observed_at":"2026-08-06T12:08:16.913124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.903378Z","title":"One- shot video object segmentation","venue":null,"work_id":"3d8e2c4a-e94b-4620-897b-07690ccffe94","year":2017},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.011827Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:f8d1a645b4e802d8a23ca42701d3a3fb6a061fccefd1e52e673cdb41e333315e","observation_id":"8773b124-b2d2-4903-b3b6-d09cd17b8147","resolution":{"observed_at":"2026-08-06T12:08:16.905609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.894519Z","title":"Delving Deep Into Many-to-Many Attention for Few-Shot Video Object Segmentation","venue":null,"work_id":"408f3bbf-3822-424c-a802-c63cd3771e0d","year":2021},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.013997Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:c262f57569c906aecd58e2f331fa0f9578fa3e40c28a36e209d62d9b6e7245fc","observation_id":"1f668c2b-07f4-4a5a-8632-1dda604dbf3f","resolution":{"observed_at":"2026-08-06T12:08:16.897640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.886559Z","title":"Mammalnet: A large-scale video benchmark for mammal recognition and behavior understanding","venue":null,"work_id":"0aa8c948-650e-404c-acd6-bda232877b68","year":2023},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.016327Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:f0df788980f1b1e542ba263aaa37b574fce0edc3e394fa9b66187f7bccd63c0b","observation_id":"8895293e-f678-4b3f-a522-a4274ce282a6","resolution":{"observed_at":"2026-08-06T12:08:16.889276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.878641Z","title":"Efficient video action detection with token dropout and context refinement","venue":null,"work_id":"d9facf98-eaca-4b79-b7d6-4bd91926a773","year":null},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.018432Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:6d3cb489df48e0e94770f7740b216cd368b9ff3bd3777455510c1fb1e21b94ef","observation_id":"a0c15148-c514-4a77-b76f-b19791ff6042","resolution":{"observed_at":"2026-08-06T12:08:16.881350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.870366Z","title":"Xmem: Long- term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":"5c429b22-6fd1-49ab-835d-175b49f4e208","year":2022},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.021542Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:da1b028b8e588a3b3674303e40ccfaa92b9a7714f92d9a0ab9d7de19e4fbe7b2","observation_id":"09cae205-c40c-4431-8dbd-65ed03fe5e2a","resolution":{"observed_at":"2026-08-06T12:08:16.873004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.861039Z","title":"Rethinking space-time networks with improved memory coverage for efficient video object segmentation.Adv","venue":null,"work_id":"b33373e7-7e4a-4afe-86bd-a05e7103aed8","year":2021},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.024411Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:977d29ca9465b93641f6b402661eaae0527763bb604b76678e4acb14020a2f78","observation_id":"dd638a44-6759-45cd-846f-fdf18e3da476","resolution":{"observed_at":"2026-08-06T12:08:16.864476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.851539Z","title":"Putting the object back into video object segmentation","venue":null,"work_id":"c09cda32-27cb-4704-b4b3-584b47e58ff1","year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.026637Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:22ce14ad7859f3412e4fbb2d94f4903959d4ae7684567143472b09d9ba2f1408","observation_id":"69d97f53-c1e4-4760-b5cb-423d63c0db32","resolution":{"observed_at":"2026-08-06T12:08:16.854386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.843076Z","title":"Haa500: Human-centric atomic action dataset with curated videos","venue":null,"work_id":"ecc3a25b-8a59-46b9-bdc4-aeed7ab160a6","year":2021},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.028655Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:9c8f2bf2eb6e04e3098a98ed18b66e68b1f6659a5800c05ef046ba92cadac2ab","observation_id":"5325d3c4-01c8-4380-997a-9b4ea3360393","resolution":{"observed_at":"2026-08-06T12:08:16.845638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.835329Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"b40dc63f-6c84-4aaf-ba4d-768f0969a138","year":2009},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.030492Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:3a06d1850408124444caf9ffb8e529ce11ad904602b5870ffb89cc2cc578faf2","observation_id":"a709749d-e5f6-43ae-b7fe-3be10fd5795e","resolution":{"observed_at":"2026-08-06T12:08:16.837934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.828016Z","title":"MeViS: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":"6d422ede-6019-4f5a-b0f6-c715a035b531","year":2023},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.032924Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:98208d871d86c6d29c45dd0a22ec4369ea36f10c134f0cff9aebe0e85050ea0a","observation_id":"e9e74f50-5b60-4379-8bce-b3bb4b2d1e9d","resolution":{"observed_at":"2026-08-06T12:08:16.830553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.821247Z","title":"MOSE: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":"fc7c61ed-8d29-4914-8a41-40909722c243","year":2023},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.035303Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:6d895d2712972bdf61ee10fabdc08cb107282c2d8f10a4a62cb591c7d9fc297c","observation_id":"493b8520-302b-43f7-9840-af791c67bc3b","resolution":{"observed_at":"2026-08-06T12:08:16.823428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.037471Z","title":"Multimodal referring segmentation: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.037471Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:0abf8efcbe29027723fc5336bcc19109efc2309d0c1a81787c4b06f18f05f3f8","observation_id":"12c8dce3-7b1e-49eb-b174-917b51e83973","resolution":{"observed_at":"2026-08-06T12:08:16.037471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.810548Z","title":"MOSEv2: A more challenging dataset for video object segmentation in complex scenes","venue":null,"work_id":"0b131af0-aea7-4114-92d7-278090477e51","year":2025},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.039658Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:1d62d416e257b10d594ab59ac89aeea0d3488717a644d864d29eaf28431b5a15","observation_id":"f4d77e95-c8b7-465a-bfa8-1b0c1ab7619e","resolution":{"observed_at":"2026-08-06T12:08:16.812903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.804548Z","title":"Wlasl (world level american sign language) video, 2022","venue":null,"work_id":"8ac98ca4-55c9-40dc-a596-4b53534b3bd7","year":2022},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.041979Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:fc2cde6b763d19706ff87da5ebc81574f84b0cd211d8f5ff40c4a7f3a491fb98","observation_id":"3d844e94-2945-43a1-b86b-f08ad6f4ded2","resolution":{"observed_at":"2026-08-06T12:08:16.806750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.796907Z","title":"Few-Shot Video Object Detection","venue":null,"work_id":"8f43a12c-c667-4c79-a467-43723830bb6b","year":2022},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.045059Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:b5820bac9d82d62f6c3c5d40a0d66c5336652d33224e2af58323eded96317eb4","observation_id":"7bd56db0-c318-4b9d-84d0-33c33a11bbc2","resolution":{"observed_at":"2026-08-06T12:08:16.799309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.790946Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"6dfcb0b1-db33-4196-82ff-5e29481a31c4","year":2016},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.047711Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:90e05c0d39e308d787a84c38ee7f8374a6936e91991625dc79ae38688f5aa1ce","observation_id":"d9324833-cf89-4dbe-a353-929e40d13cea","resolution":{"observed_at":"2026-08-06T12:08:16.793196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.783094Z","title":"Decoupling static and hier- archical motion perception for referring video segmentation","venue":null,"work_id":"3cdd3a2e-0ce4-4abb-995c-f08b57af96b5","year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.049806Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:b30d6e45940671d967bd48e919814ad71ee67853025985653623d94ee797e2b9","observation_id":"138bcb73-5943-496d-981a-e489fbcc1ae3","resolution":{"observed_at":"2026-08-06T12:08:16.785704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01143","last_updated":"2025-04-26T03:22:14Z","snapshot_observed_at":"2026-08-20T19:33:12.526162Z","submitted_at":"2025-02-03T08:22:46Z","title":"ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01143","snapshot_observed_at":"2026-08-06T12:08:16.051760Z","title":"Asap: Aligning simulation and real-world physics for learning agile humanoid whole-body skills","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.051760Z"},"links":{"cited_paper":"/paper/2502.01143","citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:80e3ea2e7e72120cfe6e8fe92865081f713722310d7e6cd54c8d6669aeee9a05","observation_id":"e0fc35e7-98da-4ee0-8f48-a4e7900343dd","resolution":{"observed_at":"2026-08-06T12:08:16.051760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.776124Z","title":"Lvos: A benchmark for long-term video object segmentation","venue":null,"work_id":"2d05fab3-e57b-405e-8546-672fa12a0c31","year":2023},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.054560Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:ca3f97d0d8b73b93bb97e7bc4e312355217239bc918bf443040729bd5ab887bf","observation_id":"e292b05d-60ac-42f5-b7af-73ef8292df45","resolution":{"observed_at":"2026-08-06T12:08:16.778742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19326","last_updated":"2024-05-01T01:30:58Z","snapshot_observed_at":"2026-08-21T13:11:39.500659Z","submitted_at":"2024-04-30T07:50:29Z","title":"LVOS: A Benchmark for Large-scale Long-term Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19326","snapshot_observed_at":"2026-08-06T12:08:16.056874Z","title":"Lvos: A benchmark for large- scale long-term video object segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.056874Z"},"links":{"cited_paper":"/paper/2404.19326","citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:75089efdf298cffdf447893b0744e27e3b8937a5cc0d428a9ccf6f59518112e8","observation_id":"c4a40569-5794-4b1c-981b-83e3801be370","resolution":{"observed_at":"2026-08-06T12:08:16.056874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.768184Z","title":"Motionbench: Benchmarking and improving fine-grained video motion understanding for vision language models","venue":null,"work_id":"62a540b5-d810-45f3-9c02-e78152c2a566","year":2025},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.059356Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:fb899d0205990997dda2c77d17e02611268709cc2dece124e0cbb3483d86856f","observation_id":"41aeb42b-5027-4f10-b26b-fb8e429665ce","resolution":{"observed_at":"2026-08-06T12:08:16.770603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.760644Z","title":"Visual recognition of chinese traffic police gestures based on spatial context and temporal features","venue":null,"work_id":"bcfabaa4-6ed5-4b18-b94d-c05ff65b8ad0","year":2020},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.061350Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:1cd098c0dc892f3d68988eb263abc42de289dfe69ba7973d45416a01a415ea74","observation_id":"5030c1e2-f2d4-4ef2-8791-93453f17f2b5","resolution":{"observed_at":"2026-08-06T12:08:16.763011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-20T22:03:51.775198Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T12:08:16.063709Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.063709Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:d69a6c1325175833c3208c8e0639ac7461df7d84326eb68608fa6fc19f993bbc","observation_id":"7e2cc777-7d92-401f-9a38-6dbeed720191","resolution":{"observed_at":"2026-08-06T12:08:16.063709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-16T17:37:32.748173Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01136","snapshot_observed_at":"2026-08-06T12:08:16.065856Z","title":"Referring video object segmentation via language-aligned track selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.065856Z"},"links":{"cited_paper":"/paper/2412.01136","citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:c3c371f5c0e50d96bd95d64fb4f5d77b023b27b61dbdec4d171b4f9640c74f8d","observation_id":"ec8a01c8-6981-4e8b-8e64-4b8fa22f65bb","resolution":{"observed_at":"2026-08-06T12:08:16.065856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.754602Z","title":"Segment anything","venue":null,"work_id":"f52db257-c90a-4c90-a13c-ec891deac337","year":2023},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.068524Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:c2b4fb14a575f541d4a408092d7923f5fbb61c32481463100ab52f110cc39393","observation_id":"3e8232f0-2036-4e4f-97d0-0986bf434ce6","resolution":{"observed_at":"2026-08-06T12:08:16.756780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.748360Z","title":"Learning human interaction by interactive phrases","venue":null,"work_id":"d5728a5b-4a6e-46fc-bdb1-790a8f420d51","year":null},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.071142Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:59f64ac35a828b5ef7e97904411e0264da8f6c21cdcbb60b7462521691fdf4a5","observation_id":"e4c84c08-4789-4e64-b453-d61d952bcd48","resolution":{"observed_at":"2026-08-06T12:08:16.750715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06644","last_updated":"2021-10-18T12:53:47Z","snapshot_observed_at":"2026-08-16T18:26:44.584458Z","submitted_at":"2019-11-15T14:09:47Z","title":"You Only Watch Once: A Unified CNN Architecture for Real-Time Spatiotemporal Action Localization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06644","snapshot_observed_at":"2026-08-06T12:08:16.073610Z","title":"You only watch once: A unified cnn architecture for real- time spatiotemporal action localization","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.073610Z"},"links":{"cited_paper":"/paper/1911.06644","citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:2d7ff920bb577385a70a3eed37ffb05177c8f716284d5e2f2d498e5e507b69db","observation_id":"3417e466-8583-4423-9037-0ad64055c02c","resolution":{"observed_at":"2026-08-06T12:08:16.073610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.739937Z","title":"Hmdb: a large video 9 database for human motion recognition","venue":null,"work_id":"e7c049c5-93b6-4a38-b601-71c83aa137d2","year":2011},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.075996Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:961b5ff0a4f14eb31c1aa7d519204da24ae30531228b0af67399621319e24efb","observation_id":"9e578118-e2d0-4316-9a2b-5d9dae65a57c","resolution":{"observed_at":"2026-08-06T12:08:16.743015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.732302Z","title":"Motion expressions guided video segmentation via effective motion information mining","venue":null,"work_id":"4416d75c-a54b-40bc-9c3e-c141a8d4e167","year":2025},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.078111Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:ee3a6450c66a49bd9df694349eaa9f7edf5cc3d6b54cdf905fc969c84d032b74","observation_id":"a5b767e8-1412-4cb5-8a6f-c31e275c5618","resolution":{"observed_at":"2026-08-06T12:08:16.735287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.725526Z","title":"Ai choreographer: Music conditioned 3d dance generation with aist++","venue":null,"work_id":"22dcec24-a4c1-43ed-a841-95bcb982a5b2","year":2021},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.080163Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:911aa92e04b1d969dd5a32c4110f62c822ee50fef8846642d24c92ad78844132","observation_id":"bd273a5b-f209-4d5c-ab22-aa05e084396a","resolution":{"observed_at":"2026-08-06T12:08:16.727745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.718096Z","title":"Multisports: A multi-person video dataset of spatio-temporally localized sports actions","venue":null,"work_id":"05cd2243-40df-4d0e-a95f-73361155087e","year":2021},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.082026Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:980b030a5a21ebf71c80d43166f58276d7f874566ec5c42b8d86413b795860e2","observation_id":"32a9fc58-f0a6-4698-8a3a-0ef6a0d48c90","resolution":{"observed_at":"2026-08-06T12:08:16.720344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04533","last_updated":"2025-03-10T12:14:22Z","snapshot_observed_at":"2026-08-16T13:00:35.361665Z","submitted_at":"2024-12-05T17:42:37Z","title":"Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":"2412.04533","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04533","snapshot_observed_at":"2026-08-06T12:08:16.219012Z","title":"Mask-Adapter: The Devil is in the Masks for Open-Vocabulary Segmentation","venue":"cs.CV","work_id":"ece71c1d-459c-4377-91d7-7993cc620c67","year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.084026Z"},"links":{"cited_paper":"/paper/2412.04533","citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:16c3fc67951516dcc6dd3aa58d20210bf068b8d72f97b7a5db502a507d3d0a92","observation_id":"62f4891b-36a5-4b74-beb9-9aca5a8f5d0d","resolution":{"observed_at":"2026-08-06T12:08:16.221782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.710794Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":"b6fa0ea1-1281-4c68-80bd-8fd80ebf071a","year":2017},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.086797Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:5a0b40992bc00764a2bfdf7db2f309d9dbc759df86a7bae4378509d5ec2196ac","observation_id":"cf9179b4-bc23-40a3-8c80-b958ec4354f9","resolution":{"observed_at":"2026-08-06T12:08:16.713650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.702903Z","title":"GRES: Generalized referring expression segmentation","venue":null,"work_id":"cb3db70a-d12d-4783-ab8c-410c776c0408","year":2023},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.089127Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:87cc9a04ff82e3c0ac10d1b380f6b75a2df6d7d4687d2c5f224ff1bd2c06a1f1","observation_id":"bd4e7831-859c-4b51-accb-d3847855c4f7","resolution":{"observed_at":"2026-08-06T12:08:16.705743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.091527Z","title":"Primitivenet: decomposing the global constraints for referring segmenta- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.091527Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:00749de7a1e153354495aa70055d6f9fc30a4adbdbe6ffdc8530904b02e8ad83","observation_id":"ff82be1b-094f-43ea-8c1b-417c49006083","resolution":{"observed_at":"2026-08-06T12:08:16.091527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.691994Z","title":"Multi- grained Temporal Prototype Learning for Few-shot Video Object Segmentation","venue":null,"work_id":"106b97fe-3ade-4703-9c3b-86be61d6db0f","year":2023},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.093537Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:9378f5d23906bf24c9f4c27aacbb40ee9595128dbfe1667ec6357e676e2b1b5c","observation_id":"da5b03f8-84d4-4497-923f-a09258b11477","resolution":{"observed_at":"2026-08-06T12:08:16.694216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.684242Z","title":"Convbench: A multi-turn conversation evaluation benchmark with hierarchical ablation capability for large vision-language models","venue":null,"work_id":"8e4e6bfa-ce22-4373-8955-04f0d590606f","year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.095367Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:e166fe5a98671784e1e1600f481acc65029f256cbe24fa7dd5eff27be3646041","observation_id":"fbddb537-7920-4cf4-ba96-c2c90088ee1c","resolution":{"observed_at":"2026-08-06T12:08:16.687163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.677000Z","title":"Video swin transformer","venue":null,"work_id":"b03fabac-5ca2-403d-8128-63fd9f4605d1","year":2022},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.097659Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:2af9b9838ffde464ad0ecbc28f223a07a10d1aa8fbd744ec8820b94a96ef9206","observation_id":"1f5727ca-7df6-43a6-9b4c-6122e9e333f6","resolution":{"observed_at":"2026-08-06T12:08:16.680027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.670031Z","title":"Exploring the Better Correlation for Few-Shot Video Object Segmentation","venue":null,"work_id":"82aab0ea-fde3-48dd-afd7-e94084d5bc8d","year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.099530Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:193f68dbd91518d8b9d3738bdcd555abac7cc1551dc2253cd2c407af562f8fe6","observation_id":"6906027e-85f8-4fab-90e1-372120db8d14","resolution":{"observed_at":"2026-08-06T12:08:16.672270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.661554Z","title":"Holistic prototype attention network for few-shot video object segmentation.IEEE Trans","venue":null,"work_id":"eb24e066-af3c-4b97-b077-6cfe7f660bbc","year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.101512Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:87547cfb8eea2302bc04f765d3b5d3e36438acc89dc742446a9ac4b5cf542e75","observation_id":"46034085-f3ad-4497-b4f2-82100228f9c3","resolution":{"observed_at":"2026-08-06T12:08:16.664519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.652402Z","title":"Few-shot video object segmentation with prototype evolution","venue":null,"work_id":"e1ca4bca-f59c-41ab-875d-abbcd343d7cf","year":null},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.103689Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:2b7513d9b1e1bf0d81861add76284d37e2ea9fbc1992f8b4639c2bc4dd9d0a16","observation_id":"6d14482c-7a08-45ed-a942-1c76e39b8978","resolution":{"observed_at":"2026-08-06T12:08:16.655363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.644205Z","title":"Video object segmentation using space-time memory networks","venue":null,"work_id":"f8ce1167-adc8-4643-aac4-9d1e38dd733c","year":2019},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.105868Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:07014037815d7da1f525cd40b1e91fa47c0250648a32caf04607cd3481155e1c","observation_id":"b76a0310-7bd6-46e0-8e25-2528cc28a26c","resolution":{"observed_at":"2026-08-06T12:08:16.647217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.637466Z","title":"Actor-context-actor relation network for spatio-temporal action localization","venue":null,"work_id":"9748ca3a-c609-4f60-98ca-66c96095ce4d","year":2021},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.108400Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:6b5d9482498c5303d563004bf3f3656eb27e36a9d96e200298490dfb0d462e5a","observation_id":"6ccbbec5-4275-4900-bf38-bdca08ff8541","resolution":{"observed_at":"2026-08-06T12:08:16.639748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.629847Z","title":"Idd-x: A multi-view dataset for ego- relative important object localization and explanation in dense and unstructured traffic","venue":null,"work_id":"27128914-e0a1-49b9-9683-2c0b3b15c3d1","year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.110316Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:d6fa64405e15b4987ae7de3f40930f8577de9713ee2bc76cb2e92e9f313d2c10","observation_id":"fc802e4b-8ae6-475f-a063-6d052fec82b5","resolution":{"observed_at":"2026-08-06T12:08:16.632502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.622117Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"55e66696-a8f3-404a-8a10-7ddfda37c7fc","year":2016},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.112148Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:0e51cb71792374000641372c08034e785d9fc621c079e260ae374db1a119abbd","observation_id":"4a4b0af2-4cc7-4d4d-912a-31b3dc35b1ee","resolution":{"observed_at":"2026-08-06T12:08:16.624874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T12:08:16.116536Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.116536Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:3b6f58a7ab5a6a042a7d6b3f8a1e4dd455001bf2b6b18ed883ba0e38d1dc8419","observation_id":"fcc037f4-3b07-4ca0-b724-560a27e42420","resolution":{"observed_at":"2026-08-06T12:08:16.116536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.616147Z","title":"A 3- dimensional sift descriptor and its application to action recognition","venue":null,"work_id":"b4f0b33c-9cc6-4cab-a401-1f4bc0e2ea3f","year":2007},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.118264Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:7e3779f8ec3a73998894873027d28d295ad1d06b1335173c12c31561d587c94a","observation_id":"a6ef31c2-97e2-4bcf-842f-231ec4fc9430","resolution":{"observed_at":"2026-08-06T12:08:16.618252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.608646Z","title":"Temporal action localization in untrimmed videos via multi-stage cnns","venue":null,"work_id":"351fea87-2a1d-4843-990d-bf9c57cdd55e","year":2016},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.120073Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:b0444436bbcd62cd22a85b9c087c352a02211c66f024add4eb97994a280dfd8f","observation_id":"ae690d97-cd0d-4c28-afb3-5628d5620d60","resolution":{"observed_at":"2026-08-06T12:08:16.611032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.600588Z","title":"Temporal transductive inference for few- shot video object segmentation","venue":null,"work_id":"ea42f9d4-c4b1-42f3-a38d-2a2f580999c4","year":2025},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.122084Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:7f68b6cd3fe2479702b69a9d5222268b7ca417026cd507519afa15c65ff887cf","observation_id":"a374e6e7-e953-45ee-8ea5-762778319ae3","resolution":{"observed_at":"2026-08-06T12:08:16.603158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14308","last_updated":"2023-07-16T13:31:17Z","snapshot_observed_at":"2026-08-16T17:11:30.568265Z","submitted_at":"2022-03-27T14:08:30Z","title":"Temporal Transductive Inference for Few-Shot Video Object Segmentation","version":2},"cited_work":{"arxiv_id":"2203.14308","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.14308","snapshot_observed_at":"2026-08-06T12:08:16.198864Z","title":"Temporal Transductive Inference for Few-Shot Video Object Segmentation","venue":"cs.CV","work_id":"16ef2f10-1e8c-4a8c-97df-c91168a1e707","year":2022},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.124190Z"},"links":{"cited_paper":"/paper/2203.14308","citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:c4912dca823e03f71dc81331394e1ba7e9b3ead0bf1ceee878c6135bcdbf1d9f","observation_id":"2977e06e-8ec8-469c-89d4-81573e1e194f","resolution":{"observed_at":"2026-08-06T12:08:16.204074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T12:08:16.127533Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.127533Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:d8027373eb8855cbbcfdeee18c1f338f7e1eb3c468e438e1743f6ea38adfc58b","observation_id":"9b6a46df-856a-4f44-a370-39189a2baf95","resolution":{"observed_at":"2026-08-06T12:08:16.127533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.592420Z","title":"Holistic prototype attention network for few-shot video object segmentation","venue":null,"work_id":"e661414e-1576-44b9-8cf6-45a96c75d879","year":2023},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.130021Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:a784c80389c8a4fc13a1101910f41aa1e0f97abad70e0a1194079f24a4e422a5","observation_id":"60d6232b-1910-428f-9dcd-9858cd65e9e9","resolution":{"observed_at":"2026-08-06T12:08:16.595086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.532890Z","title":"Visualizing data using t-sne","venue":null,"work_id":"346c9d4d-50f7-4380-a18e-98a52494d2fb","year":2008},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.131919Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:7cd221691ca600fb290f7e702323f6efbf4f753d207e20bc5b63973bb2ae3981","observation_id":"c968d370-7f39-4d08-b1f7-d9f4ba9292f4","resolution":{"observed_at":"2026-08-06T12:08:16.559312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.469211Z","title":"Action recognition with improved trajectories","venue":null,"work_id":"619d7091-d1a0-4d51-9c53-a61699b4754b","year":2013},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.133690Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:e5ecd4c5aa774db1125dc6ebfc8ad6775161b8e5c284598f3d41e1f434d8fde8","observation_id":"4d8f2139-c9fb-4b4a-9b5c-fc97222abf92","resolution":{"observed_at":"2026-08-06T12:08:16.497319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.407744Z","title":"Panet: Few-shot image semantic segmentation with prototype alignment","venue":null,"work_id":"017a999f-6dc1-4bec-925b-23ba332ca6ae","year":2019},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.135736Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:6c18482a499121b75303f17a43031df4cd741705807e205e483d88683e06d71e","observation_id":"194b3a6e-1480-40d3-95bc-22e44b2cf14d","resolution":{"observed_at":"2026-08-06T12:08:16.431975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.364718Z","title":"Monet: Deep motion exploitation for video 10 object segmentation","venue":null,"work_id":"25b93f26-c6b2-4d6c-97bc-82777d9c9c1b","year":2018},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.138193Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:ace19623c219429745f5a363c8de84f3fa036fecc993da8e315bb278cfc62330","observation_id":"0c526432-85a7-4d78-a8c8-e5eecc00cfd1","resolution":{"observed_at":"2026-08-06T12:08:16.377670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.354581Z","title":"Self-calibrated cross attention network for few-shot segmentation","venue":null,"work_id":"c6b655b9-924e-4ccb-9a36-177e5de68090","year":2023},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.140491Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:df67c1ff52856db5323e64abf073259e3c3f37504c463c79b7f98ee7f0f97ef9","observation_id":"7fc5cfe9-6a50-4d0a-a3b4-38ceeaacf092","resolution":{"observed_at":"2026-08-06T12:08:16.357149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.347733Z","title":"Eliminating feature ambiguity for few-shot segmentation","venue":null,"work_id":"8d850c51-de91-4691-9ba5-6b5b91356efc","year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.142571Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:fea9b04beba2945b793587abc84b889b61909a236ad910ecf8cd1a60e0cf0495","observation_id":"4fb0f765-076f-416a-9dea-27146a9c9db2","resolution":{"observed_at":"2026-08-06T12:08:16.349929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.340935Z","title":"Referred by multi-modality: A unified temporal transformer for video object segmentation","venue":null,"work_id":"c2ec548b-6982-4b7b-8316-7296c3e5206a","year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.145934Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:d8f2c07614dd53068c934af49b0abdd6ebc3770b6f03a47cdfbf16e729f1605d","observation_id":"9e8d7845-3492-4490-b694-5d8616155e52","resolution":{"observed_at":"2026-08-06T12:08:16.343672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.333711Z","title":"Efficient video object segmentation via network modulation","venue":null,"work_id":"5567a4b2-a525-46f9-b7cb-6fe4df7f06fd","year":2018},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.147910Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:583e9caea5cb15b456057b2f1431f6699666d878e4572160fa0088481d717fc3","observation_id":"4b8051fc-b8b9-41b9-98ec-0b7e7fe0377b","resolution":{"observed_at":"2026-08-06T12:08:16.336142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.326844Z","title":"Video instance segmentation","venue":null,"work_id":"d144a73a-5d1b-49ac-9e9c-755dba7e5b26","year":2019},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.150792Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:c161310f8698ba668b28048dd2e76ad8539b7c4f072e85a5a1b1e2f6ff0d19d0","observation_id":"054408e2-6aa4-4bff-b052-f4a7ef482b68","resolution":{"observed_at":"2026-08-06T12:08:16.329256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.320571Z","title":"Revisiting anchor mechanisms for temporal action localization","venue":null,"work_id":"d6bc4706-def1-4226-ad26-c83e028c24bc","year":2020},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.153650Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:044053ff5f1dd102f787c70628be1503398aa188f162fd8d466015fc5c5882f1","observation_id":"1b768510-8b0f-4fae-9471-7865c32c4b6d","resolution":{"observed_at":"2026-08-06T12:08:16.322760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.155718Z","title":"Isda: Position-aware instance segmentation with deformable attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.155718Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:15072d355f17cbf71f8963d20ae9d5fdc9466acde80ba9ccb264fa4d162cefaa","observation_id":"0a50103f-435f-459b-a1af-9f4c4c1504cc","resolution":{"observed_at":"2026-08-06T12:08:16.155718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.309138Z","title":"CTVIS: Consistent training for online video instance segmentation","venue":null,"work_id":"06f44fc0-1b49-455a-a094-054e7010a449","year":2023},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.158199Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:881056b6cb44d83cc056a07acaf990f86fb4b8ca36580ccc54666c2e578f297b","observation_id":"f9b13a26-df74-4ef8-8984-1ad314392309","resolution":{"observed_at":"2026-08-06T12:08:16.311500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.301990Z","title":"MMT-bench: A comprehensive multimodal benchmark for evaluating large vision-language models towards multitask AGI","venue":null,"work_id":"2f0c825a-30e0-4378-9add-48c40ed0fde6","year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.160217Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:9357789c25d5c6d242187f38845725e2c5d6ea8b5335ffd1a65b292ffa60cc66","observation_id":"7e595d13-1169-46dd-9a71-b04480164038","resolution":{"observed_at":"2026-08-06T12:08:16.304755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.294210Z","title":"Towards omnimodal expressions and reasoning in referring audio-visual segmentation","venue":null,"work_id":"8691ceef-3ecf-496a-9c6a-660cc084fb86","year":2025},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.162301Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:05baa60abfe8ef56479d5d485886f9f95a907bd6566e6065d72409decf6c0458","observation_id":"23b51e3e-d4b3-4a57-9706-1181c6167e3e","resolution":{"observed_at":"2026-08-06T12:08:16.297556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.286934Z","title":"Few-shot segmentation via cycle-consistent trans- former","venue":null,"work_id":"054255ac-e475-4514-a4a4-ee34d5f503c7","year":2021},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.164669Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:2edb552536034da04c397876f782d61f1b76e9065df49f07e758ba8fd2e537ad","observation_id":"dbffd559-a252-404d-87f0-5d48be7b150b","resolution":{"observed_at":"2026-08-06T12:08:16.289409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.278950Z","title":"Egogesture: a new dataset and benchmark for egocentric hand gesture recognition","venue":null,"work_id":"56bc5cfd-5705-4f78-9202-8fbfc8f2a187","year":2018},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.166496Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:9c9e40592135ae22e8cd3fd004e127610d2086071131ed3d1a2935baf5d2073d","observation_id":"ead07dd2-5236-417d-b7cf-3527895a12c6","resolution":{"observed_at":"2026-08-06T12:08:16.282230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.271574Z","title":"Video self- stitching graph network for temporal action localization","venue":null,"work_id":"961e016f-57c5-4411-9a5b-cd5ddec008c1","year":2021},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.168168Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:3148510b222cf62aa97206a901253c58d9cc6757965a286b89ac976aa3b5ce22","observation_id":"c5f6811d-f8ed-485a-82fb-d96b11673afc","resolution":{"observed_at":"2026-08-06T12:08:16.274386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.263806Z","title":"A survey on deep learning technique for video segmentation","venue":null,"work_id":"7e600447-e9d1-4243-aff8-d8d1b1f655bd","year":2022},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.170078Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:64d042f1982e54f037c6748c58e670160b74e35259aae035d84d2ea14e724e12","observation_id":"265dd258-ad75-4753-b3a6-7b01e08345df","resolution":{"observed_at":"2026-08-06T12:08:16.266072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:08:16.256190Z","title":"A key volume mining deep framework for action recognition","venue":null,"work_id":"c30fe13d-183d-44ca-96ef-73306a3d356b","year":null},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.171841Z"},"links":{"citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:43aaccaf9b385e0250a53198a0a05646996ae2568171dcb84d8a248be1f916e5","observation_id":"efc9ad12-9900-4882-9428-c8dfdbba579f","resolution":{"observed_at":"2026-08-06T12:08:16.258774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":60},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2507.22061."}