{"as_of":"2026-08-10T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2836ae80eb5fcb21d9b12c948dc01fb5306448b96e1524fb6d09baf86e3ab2f2","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T14:53:56.693464Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09876/citation-record","integrity":"/paper/2607.09876/integrity","json":"/paper/2607.09876/citation-record.json","paper":"/paper/2607.09876"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:078fc1c2d3307beb319b8b05e69d8d61e0c47c077036fdae7c7c9ca86a5b65fc","observation_id":"f01dd69e-df51-4feb-a138-323320e73d64","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Neuron84(1), 18–31 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:27c6d8bd059b74727b6f5929e9c2198a6e1628ecc167b5c90f4d4b8e38963705","observation_id":"111ea044-6f56-41a5-96b7-9313c18a624e","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE international conference on computer vision","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:f10617e2550d0207b3ca8a1abd9ef1ca6033f7ac9efe19f9498f9663aa59b6a1","observation_id":"8e26c0cd-a58c-40a6-9b97-3a9c07490673","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-07T02:30:11.447693Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2404.08471 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:f0b6dcafabf9a81b10dbe9d275bbd0b2eafa070d600b78dc0ae4e6fe781847b6","observation_id":"176db882-ad33-47b9-b690-526987fd8afc","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06772","last_updated":"2019-07-15T22:15:00Z","snapshot_observed_at":"2026-08-08T14:59:22.403059Z","submitted_at":"2019-07-15T22:15:00Z","title":"Efficient Pipeline for Camera Trap Image Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06772","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:1907.06772 (2019)","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/1907.06772","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:be2c2c469e88df8ad8ee1839028f2bb9e41b06bc1cd8cc74566cbb16bf854598","observation_id":"030d5e95-857a-4d89-ab8d-10e18bbaefd9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings ofthe European conference on computer vision (ECCV)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:50bcfef4c874c8455831800e597566d65d0ef2920a7f32b682a199ec7a5c789b","observation_id":"796e2264-56ac-4216-98fd-84e6a6fb13e5","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Behavioral Ecology22(2), 236–239 (2011)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:d5c55a38d9439b363f43045569d7a40ad20bb85f16f6dc3169bc757cf43ddcfb","observation_id":"6bb4bda3-c4db-4bb0-a39e-8c11ff04da83","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Current Opinion in Neurobiology98, 103201 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:a84420eed9c4fec1a38ae408f1e898365cf935f8e45f2ab92e6d661f4f9f1303","observation_id":"285047d8-fd20-46a0-a582-4722a7dda5b9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08937","last_updated":"2024-04-13T09:17:51Z","snapshot_observed_at":"2026-07-30T13:59:06.216516Z","submitted_at":"2024-04-13T09:17:51Z","title":"ChimpVLM: Ethogram-Enhanced Chimpanzee Behaviour Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08937","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2404.08937 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2404.08937","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:198f0d95347be2bf52c57eda8c82aa6153ef681165c6246ebd512ee1e15ff9a1","observation_id":"57915c93-565e-4e89-a68b-2275aa453983","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"International Journal of Computer Vision pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:031353c451c5e2cdf6117f991468693437683acac7c307b5cef8a031a411a1c0","observation_id":"57560e06-badf-48b4-818e-518b6dd0bdc5","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Journal of applied ecology52(3), 675–685 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:d4a671112ca8bdd1abb672f80bbce670f45f17c2a7a583d2cb4c351c83d56a26","observation_id":"6766aaa3-ee6d-4dd6-b62c-514cfcdec31c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Ethology Ecology & Evolution14(3), 199–216 (2002)","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:9562422aa1f0068376d4f7e37fbb51d443af4918537b91cde04902ba320c94a4","observation_id":"c299f90f-a6b7-46e2-b3f5-cdcabc49bac9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Remote Sensing in Ecology and Conservation3(3), 109–122 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:17a578643a6d9048c6438942f1500ed9c36f4abb3af6b4cd3a369eaec476a917","observation_id":"750583b7-16e1-496f-b635-f674707965ec","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2511.16719 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:dee2a3f87e2e108cff4b39d55e063e06a7335f2885db56ee8a7614ed2072b0a2","observation_id":"fd08f24f-6410-4364-a7a6-54e3426206ba","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:234ca9039dfd9ee9f00b17af420244d354ab3f9e6fb191a8ac1453ada5283f5b","observation_id":"3fd01b74-83f5-451e-982d-59926e834d79","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: proceed- ings of the IEEE Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:e5b81c590af48b0de92a40012c9e805fe121b0181a61a1c906e6edcbd9dee25d","observation_id":"4574b4da-d325-4eb4-958a-b9eb801f7e60","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:d44d8c9931349b181debf5f384acb1b885dbd0a64e262b0f666819a6887c5cda","observation_id":"0417d80d-476d-4130-adfb-0d4223a47b2e","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:4e8aa5a5cbbb5a5ec8f0044fa8e996696d71584653bdaac020bdbda0ba715734","observation_id":"2e98052f-ed9c-4b15-bf78-896b50e81032","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11959","last_updated":"2025-02-12T13:25:10Z","snapshot_observed_at":"2026-08-08T18:49:45.952865Z","submitted_at":"2024-12-16T16:41:51Z","title":"Gramian Multimodal Representation Learning and Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11959","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2412.11959 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2412.11959","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:c080f61816b56f92d130e3326825e8006d89fed32367f8e44e72b496704105df","observation_id":"7da1bbb5-bbca-431a-8b0b-4a87417d58e6","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Trends in cognitive sciences13(1), 36–43 (2009) 12 V","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3dcd30a112c309188102b56731c564c34583a446c2a1619d1c979054525e5894","observation_id":"5d0af8e1-379b-4516-9c97-12304769042c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Trends in Ecology & Evolution38(4), 346–354 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3ccb5f298f6aa3daf455f5ef0338f0141472e26809479773e642da47d0535a6f","observation_id":"171c21f3-1875-4cb7-a59f-d544ea03d32c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:a373d5ec6e9fbafb90b472f1c649a397924bd6257f528170a0dd756f4cccbd52","observation_id":"2b2c80b1-c02a-4028-a4ab-8ddf46fda476","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:0913e6f95d1cd95da5b4809388abfe7a1bcb54d6bb85beb587db5845159e144a","observation_id":"92d0b707-195c-4c0c-9f95-1fe0c2842892","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"IEEE transactions on circuits and systems for video technology32(8), 5680–5694 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ef819ed973b55fd7ce19c8cd951d57ee041324dde01d19166f5eaa1f3052e268","observation_id":"45bfd703-1818-4b99-a10f-0a170a8cae35","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17698","last_updated":"2024-06-03T23:24:39Z","snapshot_observed_at":"2026-07-06T18:20:57.086853Z","submitted_at":"2024-05-27T23:09:37Z","title":"BaboonLand Dataset: Tracking Primates in the Wild and Automating Behaviour Recognition from Drone Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17698","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2405.17698 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2405.17698","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:a568cb651a9ef744970c0175854b888dcd7bc149e01062e93e8de511ab44f66c","observation_id":"54f24dcf-f9da-438a-a835-e5b723a6f771","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"bioRxiv pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:be181a6d2852f691cc3ee2a4cc349fecbcf00e88f0630275004255c85672e4e9","observation_id":"469d3a07-20cf-46c2-b92a-2311d8d9cf1d","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23952","last_updated":"2025-05-29T19:02:48Z","snapshot_observed_at":"2026-08-07T12:35:45.450197Z","submitted_at":"2025-05-29T19:02:48Z","title":"Leveraging Auxiliary Information in Text-to-Video Retrieval: A Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23952","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2505.23952 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2505.23952","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ca6e5520844fc54687f6d3d6a6ea81fa7695b0bcda937dc9b2fb1229a708e471","observation_id":"1b832b2c-9da7-4d57-867e-52ebe882d8a1","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:8bd9028a892329e9aa0bc5196fc7937714830c56ea69482c4aafa1f5aa184ec6","observation_id":"8cabdd40-1e46-4cbd-9a80-dab14052fa5b","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"International Journal of Computer Vision pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:871ef290b9cdbf1aeb3c9dbce184e5ae4fd14a540634e691c5705dffe0e607e1","observation_id":"50cc1e68-7b2c-4665-826a-badd91afa63c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:347c5e03b1fd2feaf622b63bbfd5ea9340ecebc45bdf1b0a2d92795f82de8043","observation_id":"18791d2b-b7bf-475b-8f56-b3d82c5da713","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:8bd3fd46f8289a381d206f66c6f95d70cdf7a51af4b7a9744997bbc6c5e71765","observation_id":"42f079aa-a626-4875-bb40-58049c6b0adc","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:999d42c5de747f9a8a13dd1b36cca5bd8fdd9e62d751a5b8f5c3780561c8a2d3","observation_id":"8d18e021-fcfd-4b60-926a-2065464d4fa4","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2509.14233 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:584ac4a6a56393b7b945e14b00327759d2a93dfb8e4b81fb833d24191bda7fd0","observation_id":"371626c8-d373-45b4-9b3a-9d7c2b53b0ce","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Remote Sensing in Ecology and Conservation6(2), 129–140 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3fb09db5fca5ea559f7947bcadfa834fb238264b09986dd0ced14d75fd85383c","observation_id":"d0dc9271-2414-4f07-bf8f-ebf4699112fe","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:b79aa0f66adb948fa1177f1dd5428f9ffb618216e6539901db9aa8d62bbd9ca0","observation_id":"48f2d4ba-9973-4e41-8f93-095660433e54","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2310.068253(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:24177d0607f2200482b4104610ea383bdea7c60cd846411c7979e8f7be4c83c3","observation_id":"7d826271-994f-4934-96de-3ccd8e6c38e4","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"IEEE Access (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:b114937b0f3193b9c7bdd823c08d135dd51d0d8c470c640f5cd64135d2035053","observation_id":"2270ee03-fff4-4bc3-a6cc-0facff2a1ddd","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:1705.06950 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:397cf1111a607fdc753b77dcbc450cbd97e03abf9a301e3e55d188bc9be82dda","observation_id":"9e8ddf18-e500-49ab-a610-7743cdf029f8","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Science348(6240), aaa2478 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:1a41add50828296693004c09f6a120f0252f577bda8c8878df490eba47e0203f","observation_id":"4f018f8e-cb34-4c12-8520-0d367d5af935","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:cfa059d5a399cba5b23cce8b1d2b484f131d2d910e1ca3a3fdbfb60081c98c76","observation_id":"c7fbbce5-6fec-4ea8-9dc7-888d4cb37ded","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:1412.6980 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:9b953e6d14bf53ba7f7be9680271c59757d9fdea9e58c8e26707160bcfe8d802","observation_id":"ce1b1783-cb58-486d-b571-85539a2d1415","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Journal of Animal Ecology92(7), 1357–1371 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:a85bad4439f06fdfe2746c06866a483cd761165f978f6f02ff0ee07071ec9bec","observation_id":"16e9c728-25ef-4e07-acd7-69175917dea9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceed- ings of the IEEE international conference on computer vision","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:787971467952ebf23b733b78a4a4df97e7b407d838bf9eff5eea7031446471c2","observation_id":"843bfee9-1262-42c9-bb7a-148771a11ea5","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:384cab11b2631809f7bbdc8f9e08bf35c91a512777e207fbe330ac944df81cb3","observation_id":"c4009925-3aad-451d-99d2-174b93b6cad5","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Naval research logistics quarterly2(1-2), 83–97 (1955)","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:5bd33e77d9c6762047d050bd59030dc5389057c640c89f01fbefe2ef9d8aa0ad","observation_id":"926ab4e9-d461-426d-a2a1-ca40a2186671","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:2fb78097009437fa69b2deb3e3d5d34e6480a5182ab112421cad9ab367517b3e","observation_id":"498ebb8d-3f3a-47a1-9acc-6013175da885","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the 2024 conference on empirical methods in natural language processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:6eecfbd8c06063e2ea611cd375ac572ff4e7d9fbc84c91f7b4c18379d377cf05","observation_id":"5e6ddf0d-9526-459f-8bbd-84d8a3ec6bd4","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:6d079ae64959980167830592bf1296a73bbf9bd9c47dfc0bd5016d93e65fc765","observation_id":"13ee771f-c57a-4231-9cfa-f7a5f0ad6eb7","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Ecological Informatics83, 102797 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ac16b85fa8a17decc9d7549a0e31e512e83fcbbb23eb371b3cef1de2c54825d6","observation_id":"9119f306-c920-4806-bfb3-2e6a34947ec7","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-08-07T09:11:01.956830Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2104.08860 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:fc7d9d479b86cdb2d3145f2822166f87c9b7613f58a6c3797b6bb41d2c303749","observation_id":"559a8468-8043-4bd0-ad4b-54f04ec750ab","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03173","last_updated":"2025-05-06T04:38:09Z","snapshot_observed_at":"2026-08-07T21:43:51.731210Z","submitted_at":"2025-05-06T04:38:09Z","title":"RAVU: Retrieval Augmented Video Understanding with Compositional Reasoning over Graph","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03173","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2505.03173 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2505.03173","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:98e9823aa48d01dc754e34210e8bd410ede0500dd3dcd8cb213df76285b98ea0","observation_id":"ef80f3f6-6590-4486-9016-d493673eabde","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: LLM for Scientific Discovery: Reasoning, Assistance, and Collaboration (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:29d9b35bff71a10d49cff1f4b70291a968cada64c305bf5590b234f7393cb27c","observation_id":"7592f602-000a-4b79-91b9-7b05ca2561e7","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:f9d01f76f03cd610229b3680f1851d16047c99ddfbec9e2077f25132fe337eb3","observation_id":"0b2a0946-baec-49c2-a73c-49cbbaac872f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:1c309f22f4a3ff4fceba757a3f258703fd71c10c8b8fba20cdb12ce32247d813","observation_id":"1680e6f4-1efd-462a-918f-6680b236d66b","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:f3d9bbd722046d50aa7dc2cce4352205deeeb1f85ce1a58b508389ce75622f68","observation_id":"663e4d5e-1650-46c7-ac1d-0a9ed66dcedd","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Proceedings of the National Academy of Sciences115(25), E5716–E5725 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:e9c5def3dce8bdd9b5f60217820def95efe4688ba17acf26c68cd12e6b5b249f","observation_id":"ba307d14-c27d-4748-915f-bc1dbeb2da35","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:29efa8d1a9485cbd65a3887c391f78af0f15372b748a250d4185ef549bacdfaf","observation_id":"483c3fbb-9710-4d5e-befd-d5885bebf45d","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Biology Bulletin Reviews1(4), 345–357 (2011)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:9a5050f85523add3fa80b26533d223995048e334face6f293a0d0a72481bee29","observation_id":"17a0b0ab-9fbf-4f47-8462-18a4f1aa4401","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:a3082bc0cb0d4a24ecbda66d0f6881a0c33b0630db830d473f91ea869e308843","observation_id":"f1252366-890c-42cc-af0c-a474582e4f30","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:179d8a03cbeca927f2ef6c31b0e04351a0f8e3c7a9f9201cd4ebeebc0a7f617e","observation_id":"9d9f373d-3459-4c63-bd6c-5aae5b4e344b","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"bioRxiv pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:562dea70eea8e4029a9e971b7667b9b1133243c691c9d6b92b1f8af76e4b991f","observation_id":"660ba61c-ceb7-4c21-b6bd-e68e9f0f651c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Scientific Data12(1), 1200 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3acb7e96f5f0961a16e13f2eff5f80863a72772ce8d1a0ff96fbb83359df941c","observation_id":"57ef61ad-50c3-47e0-b1a1-73f455a5eac9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11326","last_updated":"2023-06-20T06:50:50Z","snapshot_observed_at":"2026-07-06T15:44:27.766505Z","submitted_at":"2023-06-20T06:50:50Z","title":"Meerkat Behaviour Recognition Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11326","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2306.11326 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2306.11326","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:b9af4c6f2d4660f56ae10c0bc603d554048738cd91b581df3299ac109c962974","observation_id":"072fa5f6-28f3-418e-93e8-492d7f260091","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: International Conference on Multimedia Modeling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3897237c1092e225afd1d8beb32aee89eb58394852b7c0efd8efc0f92120870a","observation_id":"e22d0a6c-707f-4bc2-9825-dd499b35a302","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:5c50b9ac8adfb3a9432e1d7d5819608d70c9db0c2839f8c99ceabf5cab1476a9","observation_id":"c8de2da7-f8a0-43a4-9226-e2650cf44335","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Conservation technology79(2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:eb138c81369b9607e7e4ceff71b09e3d5b9f7b324be17854799f04336a226b7a","observation_id":"c2f38a0e-b4fe-4636-86e4-3cd0bfda05da","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Methods in ecology and evolution5(11), 1170–1179 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:4da75dad3000580d7f374b76c2a646531f4b789779bf46a91aeee9f8dd4c5ece","observation_id":"f898d01b-317c-4c8f-aa4b-d76eda00b60b","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3b88d6a18ecfa731f4366b3d3fc679bcd5b23db7ba094bf4198ea8965c0d9161","observation_id":"0b404fb1-47c3-4ce8-b496-5f43f1534b71","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Frontiers in Ecology and the Environment15(1), 26–34 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:04f12ab5f554285e481c70a27ff94f124107ea29c1698dac5df3dbe088f625e2","observation_id":"ccbc4c62-38b5-4875-a2c1-952ee8278ae7","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:0d54bebdced2d7df54d450501ba557bd62f10aec6d0df778897cf225ca996b2e","observation_id":"d471b07a-5ce7-4e18-9c43-2adc7f8cc91a","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Philosophical Transactions of the Royal Society B374(1781), 20190012 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:8feed0e362305058d47b1baf3d766075957d45d163fdf3d5a540d88e3de296b1","observation_id":"2618d0d6-df96-4021-8f99-f5cba9b3e68c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Advances in neural information processing systems35, 10078–10093 (2022) 14 V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:d09a9634de6377863376fd6d964ec8947580f6de75dd71b5150ebf8269700c5a","observation_id":"8a74ec1e-a7a1-413b-8841-f3d8d33fed51","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Nature communications13(1), 792 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3d8e3fd16127a448c854fdb6050261119bbd947bd608aeadc051b469d01df03e","observation_id":"e0c223f7-941a-4edc-8ce0-024e216093a1","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:a5df925b734d9f857cb4afa0d8c0cd0829e830ae85ce4fcc79e8ae1ccf84a300","observation_id":"d35e55dc-7394-4d1a-bd08-6d1f136fb3c3","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2511.15656 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:55093e82ff194f157f917e1985bc8a8b1725d93b0d2d12f6ae94c24697ccd2a7","observation_id":"2e58e6af-7076-4b61-907d-06ae07ff38cf","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Advances in Neural Information Processing Systems37, 126500–126514 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:e6fb1657805e4094ee577d8ed3be2ccb45f340a6f3ac7e00fed897e3dc73a058","observation_id":"00cb7eaa-dbd0-4cb1-ae03-a7761b73635f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Nature Methods pp","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ccc6702163cdd4e429f04f74448c4864899ab3fb76a463667aa83542b44feb9f","observation_id":"710278fc-89c7-4255-b911-4e87a5418a32","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:df3dd8a9bae2c5a2ed49a90744f9f31bf38895a6ad16ed0908362b58f400f587","observation_id":"d7c73635-d317-4527-a8a4-9c64740c0923","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:c6795cb2ba06b43815cf23b0fbe63b1a13aa6832d4a1328f708fc655bc63d687","observation_id":"570800d4-ac1c-475e-93da-b8db0892aad9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2212.03191 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:5b3619ca38e4b852187bc4e3a3efc55d0edd6aeee46baf83475938d4ee9d9394","observation_id":"6c80b62f-cce4-4116-aa83-1fa1c792e7a0","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Moens, M.F., Huang, X., Specia, L., Yih, S.W.t","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:c34c8d6bd2c5a5f181fc9b2f32e9ee6faf9a4014d896360417dc2343a2372d8a","observation_id":"9a7bec54-73ea-4484-9547-d4efed6a338f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:a64dc76c0af32ba3e01bc787c1c31286007df84e449a82105162d22119fc092b","observation_id":"c2c1dc07-e795-4ad7-adf7-7a56ed523be6","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: The Eleventh International Conference on Learning Representations (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:1e0f5f72b1ef2734cc2e4e297414993397d43f49fa43e8f5a999c1c9c93a790c","observation_id":"3e7a1298-fbd6-4818-859d-757b881b54d9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2505.09388 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:549c28b770faaf1134b6a1d89ddb9c26b5c81d815b3d2ab9223817c27ea0a994","observation_id":"1e4e6658-506d-4ad6-8609-a11893d81313","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Advances in Neural Information Processing Systems36, 49428–49444 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:17207f33f47ec2ac6b0857c7dbcefc2138bb95b7c9e14bf2c3bd850de300455a","observation_id":"a40bf709-6764-4b81-afb7-874127225e51","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:4a7d5852662aab7d71fa4948196379e0b19c4a7be64692337593ac7ce045e2fb","observation_id":"7c142cef-6858-4642-8ee4-f778e7e5262f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"IEEE Transactions on Circuits and Systems for Video Technology35(5), 4592–4607 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:13b11f451684e2797d6ac597e1fa0fe61b1c9219166574385ef3bc1b04504e04","observation_id":"0f1aa5a6-69bb-40c5-9a72-b6bf0c3a9054","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Ecology and Evolution8(19), 9947–9957 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:a1f04cd596e745570b0f68f594a253c71ede9c6fd3a181b317cfddacc8d1045b","observation_id":"c71c078d-1a0b-4f9d-8bd4-07ea7e058cf8","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: 2025 3rd International Conference on Cyber Resilience (ICCR)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3520d72fd2706a58831cec7d8709fdc750e82a1ac0f4b08232a50a28c75eacdd","observation_id":"c70996ca-d4b5-4561-8928-324b4a1cdf3a","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3946a079acf78d4daa69c7ce0c8b2bde39d4a07426a1811ef1487adcbef76c35","observation_id":"d95a816b-4148-4874-85df-ed9db6a181b6","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:5859b01b8d2bf501a3fe57198f73695b09b800f572408b4f4fba46527d66b58c","observation_id":"f757b749-cbd6-4ead-995f-940d624dd71f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:47460d858a22f7ecefd3d4bd6cb79471e45d6d30b0218b76a55b92feb24cbf8f","observation_id":"fa6a1a92-6e44-4f8d-b2e0-9d0e9dbcb4f0","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:352e1ebc88f989299316f9d08ff8dd6a3fb9ac71538f39fb4249f1502236fabd","observation_id":"f66342fb-272b-4430-b025-e2c9b58f5b7f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13217","last_updated":"2025-06-07T01:16:44Z","snapshot_observed_at":"2026-07-06T17:33:00.716054Z","submitted_at":"2024-02-20T18:29:49Z","title":"VideoPrism: A Foundational Visual Encoder for Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13217","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2402.13217","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:11069ac7e2ea0918da591000db6c43a2df6b8bb7472d404b9cd18be4b73751e5","observation_id":"6c3ce1ed-3842-4eac-9072-dbe8019e1675","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the AAAI conference on artificial intelligence","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:4add007596a8c74a7adebe1763558b2d682251a45f479a07fdbc6be54f06d1bb","observation_id":"6ea1e093-a447-4dcc-bdca-700ef83feb93","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"characters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:e34ef1b8c80951ee7cd8d3ad7c2d50a0347e2d36873e9c22f1ff598d073ef8e3","observation_id":"5ad58b8e-9c90-4c6b-93df-d2b10ff566da","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":95,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2607.09876."}