{"as_of":"2026-08-10T14:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37effe95376875a53e46c96b079b68560b7ca9416ff4751ff1dbeb3fa6ec1c6a","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:55:41.858385Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.21353/citation-record","integrity":"/paper/2507.21353/integrity","json":"/paper/2507.21353/citation-record.json","paper":"/paper/2507.21353"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:48.393576Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"fdb0f474-264f-4ba6-a858-bcd7bf148b70","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:36.785009Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:c4f686c7bbeb7b0aadc933c20bf72f9360cc988532ee6435e69d3ef86cd9ca5e","observation_id":"9e6b3f22-96c8-4fdf-bd98-99d6283d1359","resolution":{"observed_at":"2026-08-06T12:55:48.486773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:48.190642Z","title":"Exploiting vlm localizability and semantics for open vocabulary action detection","venue":null,"work_id":"ae7766df-3432-441e-bd81-ba71a449c22d","year":2025},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:36.938943Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:a0e47a68a71ab7480001ebc7f257f1218f5ee4d0033e3a4cd3eead701caca92e","observation_id":"349e228c-2515-4f54-bef2-3dc0a1259e28","resolution":{"observed_at":"2026-08-06T12:55:48.249842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:47.952126Z","title":"Frozen feature augmentation for few-shot image classification","venue":null,"work_id":"2674fe88-148f-43db-b5e9-40125511446e","year":2024},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.050985Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:bb7c34a048dd4ec0b6febd9ac3d446ae222940a0bff91864d91150bedd56dda2","observation_id":"a4e19a9e-a116-40f2-8a43-dda1673bbca1","resolution":{"observed_at":"2026-08-06T12:55:48.040466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:47.667713Z","title":"Visualgpt: Data- efficient adaptation of pretrained language models for image captioning","venue":null,"work_id":"0d085837-5f5c-4abf-9cdf-f03f51d5b289","year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.167650Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:9b53955361b3a94e2b064fcde9fa73aa58bc43c506de1947193efe06840542d8","observation_id":"1315f334-b352-4329-9662-6fdb5718d5f4","resolution":{"observed_at":"2026-08-06T12:55:47.779631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.12171","last_updated":"2021-03-22T20:36:34Z","snapshot_observed_at":"2026-08-09T21:41:47.241528Z","submitted_at":"2021-03-22T20:36:34Z","title":"Adversarial Feature Augmentation and Normalization for Visual Recognition","version":1},"cited_work":{"arxiv_id":"2103.12171","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.12171","snapshot_observed_at":"2026-08-06T12:55:42.437168Z","title":"Adversarial Feature Augmentation and Normalization for Visual Recognition","venue":"cs.LG","work_id":"eb03c561-10b6-4ce0-84dc-1861336a0b0e","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.290334Z"},"links":{"cited_paper":"/paper/2103.12171","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:fc9d18677bc12e7a80aee0008da2cdbabe88283327a530224a96ab3468841109","observation_id":"fddb37e3-7c7c-4e32-9b25-f5f1054d910e","resolution":{"observed_at":"2026-08-06T12:55:42.537495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-07T23:47:53.537198Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-06T12:55:37.435979Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.435979Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:5a570ed03451dcb6e79d4ac083ba1e36ff2f2011b7817f2926bd79a06aca5430","observation_id":"254383df-acec-4f27-a082-f36dbfe6d5b6","resolution":{"observed_at":"2026-08-06T12:55:37.435979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:47.447058Z","title":"Autoaugment: Learning augmentation strategies from data","venue":null,"work_id":"35853151-84cf-4777-82c7-f333d3c4c925","year":2019},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.606762Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:81c92c0ac6c18ef291f381c080e03ea1cc69a8a7896c2d6172fd5fe0cf1681df","observation_id":"10f9b7f0-37fe-406c-ae7c-6055b09f2a18","resolution":{"observed_at":"2026-08-06T12:55:47.546084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:47.254688Z","title":"Clip-adapter: Better vision-language models with fea- ture adapters","venue":null,"work_id":"03f236a7-1f40-4c89-a275-becb4eb3231c","year":2024},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.752750Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:b77af1c1a0f4410de6b70a728fa3e1f7d94b9c02ec752acb39ea79b59454e38a","observation_id":"a1ef18b4-e09c-4fbb-b061-84da64288753","resolution":{"observed_at":"2026-08-06T12:55:47.336907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:47.049435Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions","venue":null,"work_id":"c37bb097-db29-4d4a-976b-36a0fed71898","year":2018},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.911344Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:8d7f7ae551997b8214845d35bcc380c368c717541a1a6a15b90eaebd0774ce6e","observation_id":"94005041-74c4-4cf2-bfba-70c183cdab04","resolution":{"observed_at":"2026-08-06T12:55:47.133805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:38.054743Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.054743Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:4674f196c505a98bed0184ebf49a98a7da91697df20562bf54eadc9902a50a28","observation_id":"f85fcdf5-329b-4cfb-a473-79972efaf6f6","resolution":{"observed_at":"2026-08-06T12:55:38.054743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:46.795333Z","title":"Interaction-aware prompting for zero-shot spatio-temporal action detection","venue":null,"work_id":"c44eab0c-25a3-4df7-8a35-ec235d552315","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.161397Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:421015ed16739c7fc9c5e61e2397dbcc80c70c5bbd0b0f601fe119be405e49fd","observation_id":"db1f0c87-1b3e-4238-9dd2-754a670352ac","resolution":{"observed_at":"2026-08-06T12:55:46.917614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:46.578766Z","title":"Interaction-aware prompting for zero-shot spatio-temporal action detection","venue":null,"work_id":"6b4299c9-72dd-4874-af22-7a7552eef71f","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.274684Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:f436ff757566edff2026a53a9514cc8b40282a55fa9e1ee512fe9a7c26306246","observation_id":"4fd9715a-7dda-45ce-8a63-e2764a9c28a3","resolution":{"observed_at":"2026-08-06T12:55:46.678765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:46.410566Z","title":"Spatio-temporal context prompting for zero-shot action detection","venue":null,"work_id":"8374b454-9148-4297-bec4-bb67ac0fef65","year":2025},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.390618Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:db72fcf0ae820942d1a3735201b9136588088799c11dcbb05c6466ce715e26f6","observation_id":"6a36ac45-cfb3-456a-ac98-2a8c50b20fbd","resolution":{"observed_at":"2026-08-06T12:55:46.474804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:38.531397Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.531397Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:aab3b96b7275fc89ea7770fc8b86c5b7c7fec2d2a77bb26eeacffee2b4616808","observation_id":"0b32c2b8-056c-47cf-ac57-d1f5024f7549","resolution":{"observed_at":"2026-08-06T12:55:38.531397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:46.163979Z","title":"Region-aware pretraining for open- vocabulary object detection with vision transformers","venue":null,"work_id":"a1229fb0-84dd-47dc-ac3d-25eca73257c6","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.641284Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:7506904298f6dec3d650512fa32ce6a821e0a55428ae9a07322addb071da5fdb","observation_id":"5bbc9bb6-f8f0-4f41-bc00-37147d0d2d25","resolution":{"observed_at":"2026-08-06T12:55:46.257650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:45.926657Z","title":"On feature normalization and data augmentation","venue":null,"work_id":"be6964c7-dd9f-45b8-9698-7dc1103abc42","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.754542Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:4b6ac3cd746cf3af420aa66dbae81a4086adca8f9db7127f91748028474ba4fc","observation_id":"69262b86-ce9e-44f5-8156-17915e2b7ea9","resolution":{"observed_at":"2026-08-06T12:55:46.032460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:45.654891Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"ef55d279-c5c7-4b4f-b1c7-1acaa9f7aa86","year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.881211Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:38f7bbfba544578ac3478ff6503ab04d4eca2f3771c773beabd9c720a0d9e057","observation_id":"27a371b8-107f-4dbc-b820-05748e87c9ce","resolution":{"observed_at":"2026-08-06T12:55:45.806299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:38.992416Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:38.992416Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:7d9d4fa4a4730871d087aaf4dd9494320dfd5165d297c22f96cd256707c653ee","observation_id":"96be9944-1086-4730-a0c1-ae2ec5354e4f","resolution":{"observed_at":"2026-08-06T12:55:38.992416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14843","last_updated":"2022-11-27T14:47:31Z","snapshot_observed_at":"2026-08-10T01:43:07.389517Z","submitted_at":"2022-11-27T14:47:31Z","title":"Learning Object-Language Alignments for Open-Vocabulary Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14843","snapshot_observed_at":"2026-08-06T12:55:39.145776Z","title":"Learning object-language alignments for open-vocabulary object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.145776Z"},"links":{"cited_paper":"/paper/2211.14843","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:4833c42a023aa87f3a0042c56b9079dc1c32319a768e58629327d305abf972d5","observation_id":"0f55c61e-cd19-4f48-a533-c1f51e3fd8ab","resolution":{"observed_at":"2026-08-06T12:55:39.145776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06353","last_updated":"2020-09-15T13:27:13Z","snapshot_observed_at":"2026-07-06T08:57:29.493849Z","submitted_at":"2020-02-15T10:03:25Z","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06353","snapshot_observed_at":"2026-08-06T12:55:39.270857Z","title":"Univl: A unified video and language pre-training model for multimodal understanding and generation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.270857Z"},"links":{"cited_paper":"/paper/2002.06353","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:c835511a82adc4f209751da677b92f4ba5ca8cba16d42073f7617251809728bc","observation_id":"af6a9cf9-bbff-42cd-8e17-e1b110e90cce","resolution":{"observed_at":"2026-08-06T12:55:39.270857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:45.425398Z","title":"Moma: Multi-object multi-actor activity parsing","venue":null,"work_id":"9c31b088-be94-4569-aadd-14388d3cefaf","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.376277Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:e85632388eab180264001d306795d9be5e699b48741a84af0dc6691fe64b0546","observation_id":"c71580c9-2a89-4a71-bd0b-32a618059631","resolution":{"observed_at":"2026-08-06T12:55:45.534123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:39.478935Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.478935Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:0dd1b647db8bc56b9726368e5e41195f4c9c346c5bf765698720c90f7c60eb4b","observation_id":"f39fccbd-82bb-4898-96f7-bd52d3dc0bbf","resolution":{"observed_at":"2026-08-06T12:55:39.478935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:45.166223Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"f7a6f7f7-a01e-4c75-bbd1-86d0eba55052","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.630606Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:d4c43d3d77899475d5cac3b75b48e7633ef925011e15d576e401d77dbb92f9ab","observation_id":"81659a12-2f1c-4cb7-98ec-2f0e983214af","resolution":{"observed_at":"2026-08-06T12:55:45.265455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:44.983427Z","title":"Videomae: Masked autoen- coders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"257b61e4-d864-4dd6-a9d0-1e2ebae22867","year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.727853Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:68713abcf46e6e15cf6629cb6a53c1f960b82d6f06b54ccb97b2c7e9e726b8f8","observation_id":"228b6ebe-8c05-44ea-9c66-b84aab72939c","resolution":{"observed_at":"2026-08-06T12:55:45.081638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:44.765821Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":"aee67657-dee0-4517-906b-45739b1f837d","year":2024},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.848204Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:331c62a852b80474ad7c33d202232ae3f234b539bcb5f595beb5542eb48f16fd","observation_id":"c5aa8eb1-7c74-400e-815e-eb4541b7dc87","resolution":{"observed_at":"2026-08-06T12:55:44.837052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:44.553939Z","title":"Feature adaptation with clip for few-shot classification","venue":null,"work_id":"572aac4e-7539-4397-9bf6-f0622df0735c","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:39.955529Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:57143d2a28844ff06ea11d275b5463d3f7bd1afff26d7ddf56b8f6acd3cd8c32","observation_id":"742852c3-85d0-42b1-a66e-8bb309ec9bde","resolution":{"observed_at":"2026-08-06T12:55:44.655749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:44.325196Z","title":"Cora: Adapting clip for open- vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"40345e0d-4d42-41a6-b1a4-6c35d5fdfab2","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.070428Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:3649e25706dcabd6bc52deb11e3a05be85dff177261783199c9ed88da11e539b","observation_id":"f6f3f7f4-705c-4f09-99ec-ec3291c07080","resolution":{"observed_at":"2026-08-06T12:55:44.410536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-06T12:55:40.226378Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.226378Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:70fa8987364cba8cca2ede70457b1421d81bb651ccc51ad6f38b5da926d02d2e","observation_id":"90e63cc7-bf95-4ea5-aa75-fa1289e5b836","resolution":{"observed_at":"2026-08-06T12:55:40.226378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04979","last_updated":"2023-03-15T06:48:23Z","snapshot_observed_at":"2026-08-06T00:46:55.995575Z","submitted_at":"2022-12-09T16:39:09Z","title":"VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04979","snapshot_observed_at":"2026-08-06T12:55:40.391207Z","title":"Videococa: Video-text modeling with zero-shot transfer from contrastive captioners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.391207Z"},"links":{"cited_paper":"/paper/2212.04979","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:4c0d94c597d0e42f9a351953705ffa20a7642f5c171f0e11973a4e188f053844","observation_id":"be5f889f-9d9e-4c31-bc0c-d8ab0347161f","resolution":{"observed_at":"2026-08-06T12:55:40.391207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:44.111180Z","title":"Vid2seq: Large-scale pretraining of a visual language model for dense video captioning","venue":null,"work_id":"4cb74d15-636c-4b3b-94b9-2b781ba6ca91","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.486806Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:0d57c16298563e0668ddec256c52717dadfdcca788690989a61f174fdfac6acd","observation_id":"a435b824-26a2-43b8-ab32-aa11018d5207","resolution":{"observed_at":"2026-08-06T12:55:44.192366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08610","last_updated":"2023-11-05T11:00:23Z","snapshot_observed_at":"2026-08-06T17:01:43.530949Z","submitted_at":"2022-04-19T02:05:56Z","title":"Image Data Augmentation for Deep Learning: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08610","snapshot_observed_at":"2026-08-06T12:55:40.626249Z","title":"Image data augmentation for deep learning: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.626249Z"},"links":{"cited_paper":"/paper/2204.08610","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:f2b43dfb641f1934cc40f155a948af1da8f39ae6473854c9540ac365898ca021","observation_id":"c0d2707b-60cc-43ad-ac3a-837849da7257","resolution":{"observed_at":"2026-08-06T12:55:40.626249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:43.910838Z","title":"Textmania: Enriching visual feature by text-driven manifold augmentation","venue":null,"work_id":"26348a77-38a9-4dea-941e-ad808c30f153","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.747236Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:b43bcefbd958fb65b4656c332ea10c4b475f770b2568ae45963a6da848c825f2","observation_id":"1dfee674-368b-4c65-a70e-9e3d971d1b73","resolution":{"observed_at":"2026-08-06T12:55:44.008802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T12:55:40.853210Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.853210Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:1018615051675219f28b5d3daff5a833324cb4bdb008cbae7467b583873e2449","observation_id":"029b2d6d-5e9d-45b5-aa3e-3c75799d9622","resolution":{"observed_at":"2026-08-06T12:55:40.853210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:43.679654Z","title":"Cutmix: Regularization strategy to train strong classifiers with local- izable features","venue":null,"work_id":"f0421497-c31f-4ed8-b39d-9e42558ce842","year":2019},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:40.973725Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:6438ad1f7f3d8f369391958c8c6be0102bdad9c7f4e487fc840ac24933e27ae0","observation_id":"f9b956d0-0445-4635-96b6-4c7a73d489f2","resolution":{"observed_at":"2026-08-06T12:55:43.803420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:43.474883Z","title":"Fasa: Feature augmentation and sampling adaptation for long-tailed instance segmentation","venue":null,"work_id":"2295b52e-91d7-4e9c-8fcf-74c56e53c1b1","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.106384Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:58d6b7d52fc9e9b36a0b91f3ed2e9b074c5a83179c5935acb4f53c7e26fe4b79","observation_id":"67fffa54-4971-474c-8cf5-517ee3aec1ce","resolution":{"observed_at":"2026-08-06T12:55:43.561454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:43.266681Z","title":"Open- vocabulary object detection using captions","venue":null,"work_id":"25115fc9-7300-4ac2-a76e-97120772bae0","year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.202202Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:70d9e226b60b0c66215ce892a8b324eef3379db59fe5687ae94e4c3337909d21","observation_id":"3778ec90-35a5-4105-af86-eea23753776b","resolution":{"observed_at":"2026-08-06T12:55:43.357916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:43.084646Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"a6674bc4-4c2f-4ad1-9108-b4e1d02fe231","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.316739Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:d628af5040e060b8cd167eb2123923a5f0f05231af00129294aa1a00afc4b099","observation_id":"f06c7f30-fcb4-4a29-84aa-7b381c0b3191","resolution":{"observed_at":"2026-08-06T12:55:43.153849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03930","last_updated":"2021-11-15T04:58:28Z","snapshot_observed_at":"2026-07-31T03:05:21.352948Z","submitted_at":"2021-11-06T18:09:22Z","title":"Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03930","snapshot_observed_at":"2026-08-06T12:55:41.440158Z","title":"Tip-adapter: Training-free clip-adapter for better vision- language modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.440158Z"},"links":{"cited_paper":"/paper/2111.03930","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:00f79373ecb9adfbf3377d5048c48352aa0ca049045c19594d0b613c1687c1b0","observation_id":"894229cf-580e-40d6-bde8-c47c77ae6cb1","resolution":{"observed_at":"2026-08-06T12:55:41.440158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09506","last_updated":"2024-03-25T02:45:35Z","snapshot_observed_at":"2026-08-10T07:05:43.618648Z","submitted_at":"2024-03-14T15:53:04Z","title":"Don't Judge by the Look: Towards Motion Coherent Video Representation","version":2},"cited_work":{"arxiv_id":"2403.09506","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09506","snapshot_observed_at":"2026-08-06T12:55:42.035329Z","title":"Don't Judge by the Look: Towards Motion Coherent Video Representation","venue":"cs.CV","work_id":"0a67c418-d91f-4312-addd-cee8ac503614","year":2024},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.609971Z"},"links":{"cited_paper":"/paper/2403.09506","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:c30c63316204b8614a011ee3c0017189c2ea6bebe81522ae1170c3b3d0a8caf2","observation_id":"5fead464-266c-48d7-bad9-279b38e5a680","resolution":{"observed_at":"2026-08-06T12:55:42.090764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:42.861617Z","title":"Regionclip: Region- based language-image pretraining","venue":null,"work_id":"e3b7b92f-2b9f-484c-b8b0-73fe89470af4","year":2022},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.733634Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:4a9cfedc4abb9ef77961d96cf7a5428d5352de49cb901d20d9af9e503e80bc98","observation_id":"ee2b1069-a638-46dd-8642-57333de3b69e","resolution":{"observed_at":"2026-08-06T12:55:42.975241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:55:42.609863Z","title":"Not all features matter: Enhancing few-shot clip with adaptive prior refine- ment","venue":null,"work_id":"f1f8dc67-c95c-41a0-b9a4-67955fa38799","year":2023},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:41.858385Z"},"links":{"citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:035225dabac71a01c61ff37b77ea60d5299949245d29da0b06a47d28fb9192f3","observation_id":"15a2ed48-d5a7-425b-9651-0d15ca654883","resolution":{"observed_at":"2026-08-06T12:55:42.726408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T02:11:39.438733Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2507.21353."}